Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой — после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда занимается алайнментом Alice AI: обучает модель вести диалог, рассуждать, следовать инструкциям, пользоваться поиском и другими инструментами. Работа направлена на улучшение качества модели после базового обучения через формулирование гипотез, эксперименты и оценку изменений в её поведении.
задачи
Формулировать гипотезы для улучшения качества модели;
Проводить эксперименты с моделью;
Оценивать изменения в поведении модели;
Использовать результаты экспериментов в следующих итерациях;
Разрабатывать и применять RL-методы для обучения LLM;
Повышать качество и стабильность обучения;
Разрабатывать инструменты для анализа состояния модели во время эксперимента;
Исследовать способы использования reward-сигнала;
Оценивать действия модели;
Регулировать обновление модели;
Проверять исследовательские идеи на моделях;
Переносить работающие решения в основной контур обучения;
Объединять изменения из разных экспериментов в одной версии модели;
Исследовать способы объединения стадий обучения;
Собирать модели-кандидаты;
Проводить комплексную оценку моделей;
Уточнять способы интеграции изменений;
Поддерживать стенд для быстрых экспериментов и приёмки изменений;
Развивать методы обучения, данные и оценку поведения модели;
Проверять качество с помощью экспертной разметки, reward-моделей и LLM-as-a-Judge;
Улучшать reasoning, tool calling и перенос качества на новые сценарии.
требования
Хорошо знать классический ML и DL;
Понимать устройство современных LLM и методы их обучения;
Уметь переводить исследовательскую задачу в проверяемую гипотезу, эксперимент и метрики;
Уметь интерпретировать результаты и находить причины изменений качества;
Интересоваться моделями с reasoning и tool calling;
Будет плюсом опыт в online RL для LLM, многостадийном обучении, distillation, instruction following, reward modeling или оценке поведения языковых моделей.
условия
Гибридный формат, доступна удалённая работа и офис;
Расширенная медицинская страховка с первого месяца;
Оплачиваются 30 дней больничного в году;
ДМС покрывает чекапы, вакцинацию, стоматологию, коррекцию зрения и лечение критических заболеваний;
Онлайн-консультации с психологами и психотерапия в отдельных офисах;
Оплачиваются ведение беременности и роды для сотрудниц и жён сотрудников, работающих в компании более двух лет;
ДМС для детей и супругов по системе 80/20: компания оплачивает 80% стоимости.