1 окт

руководитель RL-направления для VLM

ориентир по рынку
вакансия зп не указана
в среднем 348 719 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовься к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузи резюме

описание

Первый этап отбора на эту вакансию – общение с AI-рекрутером. После отклика вам на почту и в чат на платформе HeadHunter придет приглашение пройти первичное интервью с ГигаРекрутером в Telegram. Диалог займёт примерно 10 минут. Его задача — уточнить недостающие детали и ускорить рассмотрение вашей кандидатуры. ГигаРекрутер только начинает свой путь, поэтому просим относиться с пониманием. Ваш опыт и участие помогут сделать его удобным и полезным!

GigaChat Vision — команда, которая занимается полным циклом обучения VLM-моделей.

задачи

  • Формировать техническую стратегию RL-направления: определять приоритетные домены, выбирать подходы и строить дорожную карту на несколько кварталов вперёд
  • Принимать ключевые архитектурные решения по выбору алгоритмов, дизайну reward-функций и стратегии масштабирования, отвечать за них
  • Определять стратегию данных для RL: выбирать необходимые датасеты и требования к качеству, выстраивать пайплайн сбора и фильтрации
  • Определять и внедрять метрики оценки качества reasoning в eval-фреймворк, проектировать метрики для новых доменов и возможностей модели
  • Строить и развивать команду: нанимать сотрудников, проводить онбординг, менторить и делать ревью
  • Координироваться со смежными направлениями Pretrain, SFT и Infra, синхронизировать планы
  • Отслеживать развитие области и превращать идеи из статей в эксперименты и решения
  • При необходимости лично решать сложные технические задачи: отлаживать эксперименты, разбирать аномалии в обучении и доводить работу до результата

требования

  • Глубоко разбираться в RL для LLM/VLM, включая RLHF, GRPO и PPO
  • Понимать полный цикл обучения VLM/LLM: pretrain, SFT и RL, а также влияние решений на каждом этапе на итоговый результат
  • Иметь опыт технического лидерства команды от 3 человек: создавать дорожные карты, декомпозировать и приоритизировать задачи, менторить
  • Иметь опыт распределённого обучения с DeepSpeed или FSDP и работы с фреймворками inference
  • Уметь выстраивать процессы в условиях неопределённости
  • Иметь опыт взаимодействия со смежными командами и заинтересованными сторонами
  • Обладать системным мышлением и видеть весь процесс — от данных и дизайна reward-функций до eval и метрик продакшна
  • Будет плюсом: опыт найма и формирования технической команды с нуля, публикации или вклад в open-source по RL/LLM/VLM, опыт вывода моделей, обученных RL, в продакшн

условия

  • Можно выбрать гибридный формат или работу в офисе
  • Ежегодный пересмотр зарплаты и годовая премия
  • Корпоративный спортзал и зоны отдыха
  • Более 400 образовательных программ СберУниверситета
  • Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • Ипотека выгоднее до 7% для сотрудников
  • Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнёров
  • Вознаграждение за рекомендацию друзей в команду Сбера

Крупнейший российский банк и экосистема. Предоставляет банковские услуги: кредиты, вклады, карты, ипотека. Развивает сервисы: доставка, здоровье, развлечения, облачные технологии и ИИ. Удобно для финансов и повседневных задач.

Подробнее о компании →

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайся: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайся: это мошенничество.