Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Развивается GigaChat и методы обучения моделей для STEM-задач, включая математику, естественные науки, инженерные и технические дисциплины.
задачи
Развивать направление online RL для STEM-задач;
Определять приоритетные задачи, способы измерения прогресса и причины, ограничивающие рост качества модели;
Вести направление от постановки гипотез и плана работ до внедрения результатов в регулярный цикл обучения модели;
Принимать решения о приоритетах между развитием методов, сбором данных, инфраструктурой и системой оценки качества;
Развивать подходы post-training и online RL для задач по математике, физике, химии, биологии и другим STEM-дисциплинам;
Продумывать и внедрять способы оценки качества решения реальных задач, включая цепочки рассуждений, применение формул и работу с многошаговыми задачами;
Определять, когда online RL повышает качество по сравнению с supervised fine-tuning и другими подходами;
Проводить эксперименты и анализировать результаты, причины изменений качества, устойчивость результатов и возможность переноса на другие типы задач;
Писать и дорабатывать критичные части пайплайнов online RL;
Обеспечивать надёжность и воспроизводимость экспериментов, управление версиями данных и контроль деградаций;
Выстраивать связку между моделью, верификаторами, reward-сигналами и обучающими пайплайнами;
Разбирать узкие места в коде, экспериментах и качестве данных;
Организовывать сбор и подготовку данных для online RL в STEM-домене;
Формировать обучающие выборки с покрытием разных дисциплин, уровней сложности, типов рассуждений и типовых ошибок модели;
Встраивать в пайплайны проверки качества, включая верификацию ответов и промежуточных шагов, контроль утечек, удаление дублей и балансировку;
Улучшать процесс обучения за счёт новых данных, сложных примеров, критериев качества и понимания слабых мест модели;
Руководить командой исследователей и инженеров, задавать высокую планку качества и скорости работы;
Помогать команде превращать исследовательские идеи в решения для основного цикла обучения;
Поддерживать баланс между глубиной исследований, инженерной надёжностью и практическим результатом для модели.
требования
Отличное владение Python и PyTorch;
Практический опыт в LLM post-training: RLHF, online RL или смежных направлениях;
Понимание STEM-домена: формальная верификация ответов, chain-of-thought reasoning, математическая нотация, многошаговые решения и типовые ошибки моделей в рассуждениях;
Умение ставить гипотезы, проектировать эксперименты и принимать решения по их результатам;
Опыт руководства сильной технической командой;
Готовность лично писать важные части системы;
Будет плюсом сильный математический или естественнонаучный бэкграунд, опыт построения верификаторов и reward-моделей для STEM-задач, построения пайплайнов данных, работы с distributed training или large-scale inference, разработки систем оценки качества LLM, synthetic data generation, curriculum learning и active data collection, знание open-source стеков для обучения и инференса больших языковых моделей, публикации, вклад в open-source или сильный прикладной исследовательский опыт.
условия
Конкурентная компенсация, премии и расширенный социальный пакет;
Сложные задачи на переднем крае развития русскоязычных LLM;
Возможность влиять на архитектуру решений, методы обучения и качество итоговой модели;
Команда инженеров и исследователей;
Возможность совмещать управление направлением с глубокой технической работой.