Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Роль связана с инфраструктурой, пайплайнами и качеством данных для обучения современных Vision-Language Models. Работа ведётся с большими мультимодальными датасетами и потребностями исследователей и ML-инженеров.
задачи
Собирать и структурировать потребности ML-команды в данных для обучения, дообучения, оценки и улучшения VLM
Предлагать и реализовывать пайплайны очистки, фильтрации, дедупликации, категоризации и генерации данных
Ориентироваться в практиках построения датасетов для Vision-Language Models
Отвечать за инфраструктуру хранения и подготовки данных
Импортировать данные из production, Common Crawl, наборов данных с открытым исходным кодом и сгенерированных данных
Валидировать данные и контролировать их качество
Хранить и версионировать датасеты
Экспортировать данные в форматы для обучения моделей
Проектировать и реализовывать пайплайны обработки данных в масштабе десятков миллиардов изображений
Разрабатывать пайплайны генерации синтетических данных для обучения и улучшения VLM
Собирать статистику, строить отчёты и визуализации для анализа состава, качества и покрытия датасетов
Обеспечивать воспроизводимость, наблюдаемость и надёжность процессов обработки данных
Работать с ML-инженерами, исследователями и инфраструктурной командой
требования
Сильный опыт в инженерии данных и построении производственных пайплайнов данных
Уверенное владение Python, включая многопроцессность, многопоточность и асинхронные подходы
Опыт работы с большими объёмами данных и распределённой обработкой
Практический опыт работы с объектными хранилищами, в частности S3 или аналогами
Опыт работы с YTsaurus или похожими системами распределённого хранения и обработки данных
Понимание принципов валидации, очистки, дедупликации и версионирования наборов данных
Опыт работы с DVC, Git, Docker
Опыт работы с PostgreSQL или другими реляционными базами данных
Умение проектировать устойчивые пайплайны от импорта данных до экспорта в формат для обучения
Способность самостоятельно разбираться в нечетко сформулированных задачах и доводить их до работающего решения
Готовность работать на стыке инженерии и исследований машинного обучения
Будет плюсом: опыт работы с мультимодальными данными, понимание современных датасетов для VLM / LMM / мультимодальных моделей, построение пайплайнов генерации синтетических данных, реализация оценки качества, фильтрации, семантической дедупликации, кластеризации или атрибуции данных, визуализация статистики больших датасетов и создание внутренних аналитических панелей, работа с Common Crawl, датасетами наподобие LAION и открытыми наборами vision-language данных, базовое понимание процесса обучения ML-моделей и влияния качества данных на качество модели
условия
Ежегодный пересмотр зарплаты и годовая премия
Корпоративный спортзал и зоны отдыха
Более 400 образовательных программ СберУниверситета
Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
Ипотека выгоднее до 7% для каждого сотрудника
Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнёров
Вознаграждение за рекомендацию друзей в команду Сбера
Возможность быть соавтором НИРов и статей для международных конференций