Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой — после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Онлайн-кинотеатр Иви создаёт продукт, которым пользуются миллионы людей.
задачи
Развивать платформу для расчёта ML-признаков в batch-, streaming- и nearline-сценариях;
Строить и поддерживать пайплайны для исторических расчётов, backfill и обновления признаков;
Собирать обучающие датасеты без данных «из будущего»;
Работать с потоковыми данными, окнами, опоздавшими событиями и разными типами времени;
Обеспечивать одинаковый и корректный расчёт признаков в offline- и online-контурах;
Развивать единые и переиспользуемые подходы к описанию feature pipelines и датасетов;
Обеспечивать воспроизводимость и качество данных с помощью версионирования, lineage, проверок и контроля результатов расчётов;
Оптимизировать Spark- и streaming-задачи по скорости, памяти и стоимости вычислений;
Развивать incremental-расчёты, чтобы не пересчитывать большие объёмы данных без необходимости;
Интегрировать платформу с Feature Store, Airflow/Kubeflow, Kafka, хранилищами и внутренними сервисами;
Добавлять метрики, трассировку и инструменты диагностики для поиска проблем в продакшене;
Проверять систему под нагрузкой и в сценариях с отказами;
Участвовать в сопровождении своего продакшен-контура и разборе инцидентов;
Превращать вместе с ML-инженерами решения под конкретные задачи в общие возможности платформы;
Оценивать готовые open-source решения и выбирать между интеграцией существующего инструмента и собственной разработкой.
требования
Уверенное знание Python и/или JVM-языка;
Опыт разработки и поддержки конвейеров обработки данных;
Глубокое понимание Spark или другой распределённой системы обработки данных;
Опыт работы с Airflow, Kubeflow Pipelines или аналогами;
Понимание partitioning, shuffle, skew, retry, backfill и идемпотентности;
Опыт проектирования схем данных и работы с большими объёмами;
Опыт batch- и streaming-обработки: event time, processing time, окна, watermark и late data;
Понимание point-in-time joins, temporal leakage и гарантий at-least-once / exactly-once;
Знание подходов к incremental computation, caching, state и пересчётам;
Опыт работы с Git, code review, тестированием, CI/CD и observability;
Будет плюсом опыт работы с хранилищами признаков и платформами машинного обучения, опыт разработки потоковых систем и работы с Kafka, опыт версионирования, отслеживания происхождения и проверки качества данных, опыт оптимизации Spark-задач по скорости, памяти и стоимости вычислений, опыт создания переиспользуемых решений для команд данных и машинного обучения.
условия
ДМС со стоматологией, страховкой выезда за рубеж, страхованием от критических заболеваний и несчастных случаев;
Психолог, ЗОЖ-специалист и юрист;
Скидки и предложения от компаний-партнёров и библиотеки «МИФ»;
Бонусы за выступления и подготовку публикаций на внешних площадках;
Специальное предложение по подписке Иви;
Комфортный офис рядом с метро Дмитровская;
Для сотрудников с семьёй из регионов России — пакет релокации.