Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой, после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда развивает ризонинг у генеративных моделей Alice AI LLM, чтобы они могли составлять план решения, проверять разные подходы и верифицировать ответы. Для этого команда исследует Reinforcement Learning, экспериментирует с архитектурами и алгоритмами обучения и развивает инженерные подходы к работе с данными.
задачи
Создавать новые наборы данных разных уровней сложности и тематик;
Разрабатывать надёжную функцию награды;
Исследовать on-policy- и off-policy-обучение;
Развивать адаптивное управление энтропией модели;
Исследовать способы расчёта advantage;
Выбирать функционал для минимизации в Dense- и MoE-архитектурах;
Находить лучшие настройки обучения рассуждающих моделей.
требования
Отлично знать математику, классические алгоритмы и структуры данных;
Уметь программировать на Python;
Разбираться в Reinforcement Learning и policy optimization;
Иметь практический опыт распределённого обучения больших моделей на основе архитектуры Transformer;
Понимать устройство стадии alignment современных LLM;
Будет плюсом опыт обучения reasoning-моделей, работа с инфраструктурой для RL-обучения VERL, vLLM и SGLang.
условия
Расширенная медицинская страховка с первого месяца работы;
Оплачиваемый больничный — 30 дней в году с сохранением полной зарплаты;
Стоматология, коррекция зрения, ежегодные чекапы и вакцинация по ДМС;
Онлайн-консультации с психологами и психотерапия в офисах, где есть соответствующий кабинет;
Оплата ведения беременности и родов для сотрудниц и жён сотрудников, работающих более двух лет;