вчера

data engineer для обучения VLM

ориентир по рынку
вакансия зп не указана
в среднем 291 820 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовьтесь к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме

описание

Роль связана с инфраструктурой, пайплайнами и качеством данных для обучения современных Vision-Language Models. Работа ведётся с большими мультимодальными датасетами и потребностями исследователей и ML-инженеров.

задачи

  • Собирать и структурировать потребности ML-команды в данных для обучения, дообучения, оценки и улучшения VLM
  • Предлагать и реализовывать пайплайны очистки, фильтрации, дедупликации, категоризации и генерации данных
  • Ориентироваться в практиках построения датасетов для Vision-Language Models
  • Отвечать за инфраструктуру хранения и подготовки данных
  • Импортировать данные из production, Common Crawl, наборов данных с открытым исходным кодом и сгенерированных данных
  • Валидировать данные и контролировать их качество
  • Хранить и версионировать датасеты
  • Экспортировать данные в форматы для обучения моделей
  • Проектировать и реализовывать пайплайны обработки данных в масштабе десятков миллиардов изображений
  • Разрабатывать пайплайны генерации синтетических данных для обучения и улучшения VLM
  • Собирать статистику, строить отчёты и визуализации для анализа состава, качества и покрытия датасетов
  • Обеспечивать воспроизводимость, наблюдаемость и надёжность процессов обработки данных
  • Работать с ML-инженерами, исследователями и инфраструктурной командой

требования

  • Сильный опыт в инженерии данных и построении производственных пайплайнов данных
  • Уверенное владение Python, включая многопроцессность, многопоточность и асинхронные подходы
  • Опыт работы с большими объёмами данных и распределённой обработкой
  • Практический опыт работы с объектными хранилищами, в частности S3 или аналогами
  • Опыт работы с YTsaurus или похожими системами распределённого хранения и обработки данных
  • Понимание принципов валидации, очистки, дедупликации и версионирования наборов данных
  • Опыт работы с DVC, Git, Docker
  • Опыт работы с PostgreSQL или другими реляционными базами данных
  • Умение проектировать устойчивые пайплайны от импорта данных до экспорта в формат для обучения
  • Способность самостоятельно разбираться в нечетко сформулированных задачах и доводить их до работающего решения
  • Готовность работать на стыке инженерии и исследований машинного обучения
  • Будет плюсом: опыт работы с мультимодальными данными, понимание современных датасетов для VLM / LMM / мультимодальных моделей, построение пайплайнов генерации синтетических данных, реализация оценки качества, фильтрации, семантической дедупликации, кластеризации или атрибуции данных, визуализация статистики больших датасетов и создание внутренних аналитических панелей, работа с Common Crawl, датасетами наподобие LAION и открытыми наборами vision-language данных, базовое понимание процесса обучения ML-моделей и влияния качества данных на качество модели

условия

  • Ежегодный пересмотр зарплаты и годовая премия
  • Корпоративный спортзал и зоны отдыха
  • Более 400 образовательных программ СберУниверситета
  • Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • Ипотека выгоднее до 7% для каждого сотрудника
  • Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнёров
  • Вознаграждение за рекомендацию друзей в команду Сбера
  • Возможность быть соавтором НИРов и статей для международных конференций

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.