сегодня

Pretrain Data LLM Researcher GigaChat

ориентир по рынку
вакансия зп не указана
в среднем 252 679 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовься к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузи резюме

описание

GigaChat обучает одна из крупнейших ML-команд страны. Команда работает над собственной фронтирной языковой моделью, которую используют миллионы людей, и открывает модели для сообщества.

задачи

  • Вести программу экспериментов с данными
  • Планировать, запускать и анализировать эксперименты, сравнивая версии смеси данных, фильтров и порядка обучения при фиксированном вычислительном бюджете
  • Оптимизировать состав и порядок использования данных, распределяя токены с учётом scaling laws
  • Создавать классификаторы для отбора документов, насыщенных рассуждениями, кодом и знаниями
  • Курировать корпус на масштабе триллионов токенов: проводить точную и нечёткую дедупликацию, фильтрацию, очистку от утечек бенчмарков и преобразование HTML в текст
  • Искать, собирать и генерировать траектории использования инструментов, многошаговых рассуждений и взаимодействия со средой для обучения агентных способностей на этапе претрейна
  • Создавать рецепты подготовки синтетических данных для развития длинного контекста, рассуждений и навыков программирования
  • Количественно проверять синтетические данные через эксперименты
  • Развивать бенчмарки и экспериментальные наборы для измерения влияния изменений данных на качество модели

требования

  • Уметь самостоятельно формулировать исследовательские вопросы, проектировать эксперименты и доводить гипотезы до измеримого результата
  • Иметь сильные основы машинного обучения и статистики, владеть культурой контролируемого эксперимента
  • Уверенно владеть Python и иметь опыт обучения моделей на PyTorch или аналогах
  • Уметь самостоятельно вести исследовательское направление от вопроса до результата
  • Понимать цикл обучения LLM, включая токенизацию, scaling laws и влияние состава данных на качество
  • Иметь представление о распределённой обработке данных и открытых проектах в области данных
  • Опыт работы с LLM не обязателен; подходит сильная экспериментальная практика в машинном обучении, компьютерном зрении, рекомендательных системах, классическом машинном обучении или науке
  • Будет плюсом: знакомство со Spark, Dask, Airflow, Kubernetes, FineWeb, OLMo и Dolma

условия

  • Доступ к вычислительным ресурсам и одному из крупнейших GPU-кластеров в стране
  • Возможность регулярно запускать обучающие эксперименты
  • Обучение собственной модели с нуля; текущий размер моделей — 400–700B параметров, планы — 1.5–2T
  • Открытая публикация моделей и возможность сравнивать результаты с ведущими открытыми моделями
  • Минимум бюрократии, ответственность и свобода; результат оценивается по приросту модели на бенчмарках при том же бюджете
  • Развитая инфраструктура для данных и экспериментов: S3, YTsaurus, Airflow, DataLens, GitLab CI, wandb

Крупнейший российский банк и экосистема. Предоставляет банковские услуги: кредиты, вклады, карты, ипотека. Развивает сервисы: доставка, здоровье, развлечения, облачные технологии и ИИ. Удобно для финансов и повседневных задач.

Подробнее о компании →

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайся: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайся: это мошенничество.