18 авг

системный инженер платформы данных

ориентир по рынку
вакансия зп не указана
в среднем 217 766 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовьтесь к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме

описание

Онлайн-кинотеатр Иви создаёт продукт, которым пользуются миллионы людей.

задачи

  • Развивать платформу для расчёта ML-признаков в batch-, streaming- и nearline-сценариях;
  • Строить и поддерживать пайплайны для исторических расчётов, backfill и обновления признаков;
  • Собирать обучающие датасеты без данных «из будущего»;
  • Работать с потоковыми данными, окнами, опоздавшими событиями и разными типами времени;
  • Обеспечивать одинаковый и корректный расчёт признаков в offline- и online-контурах;
  • Развивать единые и переиспользуемые подходы к описанию feature pipelines и датасетов;
  • Обеспечивать воспроизводимость и качество данных с помощью версионирования, lineage, проверок и контроля результатов расчётов;
  • Оптимизировать Spark- и streaming-задачи по скорости, памяти и стоимости вычислений;
  • Развивать incremental-расчёты, чтобы не пересчитывать большие объёмы данных без необходимости;
  • Интегрировать платформу с Feature Store, Airflow/Kubeflow, Kafka, хранилищами и внутренними сервисами;
  • Добавлять метрики, трассировку и инструменты диагностики для поиска проблем в продакшене;
  • Проверять систему под нагрузкой и в сценариях с отказами;
  • Участвовать в сопровождении своего продакшен-контура и разборе инцидентов;
  • Превращать вместе с ML-инженерами решения под конкретные задачи в общие возможности платформы;
  • Оценивать готовые open-source решения и выбирать между интеграцией существующего инструмента и собственной разработкой.

требования

  • Уверенное знание Python и/или JVM-языка;
  • Опыт разработки и поддержки конвейеров обработки данных;
  • Глубокое понимание Spark или другой распределённой системы обработки данных;
  • Опыт работы с Airflow, Kubeflow Pipelines или аналогами;
  • Понимание partitioning, shuffle, skew, retry, backfill и идемпотентности;
  • Опыт проектирования схем данных и работы с большими объёмами;
  • Опыт batch- и streaming-обработки: event time, processing time, окна, watermark и late data;
  • Понимание point-in-time joins, temporal leakage и гарантий at-least-once / exactly-once;
  • Знание подходов к incremental computation, caching, state и пересчётам;
  • Опыт работы с Git, code review, тестированием, CI/CD и observability;
  • Будет плюсом опыт работы с хранилищами признаков и платформами машинного обучения, опыт разработки потоковых систем и работы с Kafka, опыт версионирования, отслеживания происхождения и проверки качества данных, опыт оптимизации Spark-задач по скорости, памяти и стоимости вычислений, опыт создания переиспользуемых решений для команд данных и машинного обучения.

условия

  • ДМС со стоматологией, страховкой выезда за рубеж, страхованием от критических заболеваний и несчастных случаев;
  • Психолог, ЗОЖ-специалист и юрист;
  • Скидки и предложения от компаний-партнёров и библиотеки «МИФ»;
  • Бонусы за выступления и подготовку публикаций на внешних площадках;
  • Специальное предложение по подписке Иви;
  • Комфортный офис рядом с метро Дмитровская;
  • Для сотрудников с семьёй из регионов России — пакет релокации.

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.