Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузи резюме
описание
GigaChat обучает одна из крупнейших ML-команд страны. Команда работает над собственной фронтирной языковой моделью, которую используют миллионы людей, и открывает модели для сообщества.
задачи
Вести программу экспериментов с данными
Планировать, запускать и анализировать эксперименты, сравнивая версии смеси данных, фильтров и порядка обучения при фиксированном вычислительном бюджете
Оптимизировать состав и порядок использования данных, распределяя токены с учётом scaling laws
Создавать классификаторы для отбора документов, насыщенных рассуждениями, кодом и знаниями
Курировать корпус на масштабе триллионов токенов: проводить точную и нечёткую дедупликацию, фильтрацию, очистку от утечек бенчмарков и преобразование HTML в текст
Искать, собирать и генерировать траектории использования инструментов, многошаговых рассуждений и взаимодействия со средой для обучения агентных способностей на этапе претрейна
Создавать рецепты подготовки синтетических данных для развития длинного контекста, рассуждений и навыков программирования
Количественно проверять синтетические данные через эксперименты
Развивать бенчмарки и экспериментальные наборы для измерения влияния изменений данных на качество модели
требования
Уметь самостоятельно формулировать исследовательские вопросы, проектировать эксперименты и доводить гипотезы до измеримого результата
Иметь сильные основы машинного обучения и статистики, владеть культурой контролируемого эксперимента
Уверенно владеть Python и иметь опыт обучения моделей на PyTorch или аналогах
Уметь самостоятельно вести исследовательское направление от вопроса до результата
Понимать цикл обучения LLM, включая токенизацию, scaling laws и влияние состава данных на качество
Иметь представление о распределённой обработке данных и открытых проектах в области данных
Опыт работы с LLM не обязателен; подходит сильная экспериментальная практика в машинном обучении, компьютерном зрении, рекомендательных системах, классическом машинном обучении или науке
Будет плюсом: знакомство со Spark, Dask, Airflow, Kubernetes, FineWeb, OLMo и Dolma
условия
Доступ к вычислительным ресурсам и одному из крупнейших GPU-кластеров в стране
Возможность регулярно запускать обучающие эксперименты
Обучение собственной модели с нуля; текущий размер моделей — 400–700B параметров, планы — 1.5–2T
Открытая публикация моделей и возможность сравнивать результаты с ведущими открытыми моделями
Минимум бюрократии, ответственность и свобода; результат оценивается по приросту модели на бенчмарках при том же бюджете
Развитая инфраструктура для данных и экспериментов: S3, YTsaurus, Airflow, DataLens, GitLab CI, wandb
Крупнейший российский банк и экосистема. Предоставляет банковские услуги: кредиты, вклады, карты, ипотека. Развивает сервисы: доставка, здоровье, развлечения, облачные технологии и ИИ. Удобно для финансов и повседневных задач.