Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой, после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда развивает ML-платформу прогнозирования спроса для федеральной розничной сети. Платформа работает с большими объёмами данных: отдельные расчёты обрабатывают терабайты, а общий объём данных измеряется петабайтами. Расчётный контур построен на Spark и Kubernetes, оркестрация выполняется в Airflow, данные хранятся в S3 и Delta Lake.
задачи
Интегрировать изменения и новые алгоритмы от Data Science в промышленный контур прогнозирования;
Разрабатывать и сопровождать Spark-приложения и расчётные пайплайны;
Работать с Airflow DAG и процессами запуска расчётов в DEV, UAT и PROD;
Участвовать в развитии MLOps-фреймворка, версионирования расчётов и релизного процесса;
Оптимизировать Spark-расчёты и помогать обеспечивать стабильное выполнение пайплайнов в рамках SLA;
Работать с Kubernetes-инфраструктурой под Spark-приложения;
Участвовать в развитии мониторинга, логирования, Data Quality и диагностики расчётов;
Работать с данными в S3 и Delta Lake, историей расчётов и процессами хранения данных;
Участвовать в развитии CI/CD и внутренних инструментов ML-платформы;
Участвовать в технических PoC и тестировании новых технологий на реальных расчётах.
требования
Хорошее знание Python;
Практический опыт с Apache Spark / PySpark;
Опыт работы с Apache Airflow;
Уверенный SQL;
Базовый практический опыт с Kubernetes и Docker;
Понимание принципов работы с большими объёмами данных;
Опыт работы с S3 или другими объектными хранилищами;
Понимание CI/CD и процессов разработки;
Умение разбираться в проблемах production-пайплайнов и работать с логами и мониторингом;
Будет плюсом опыт с Delta Lake или другими lakehouse-технологиями, опыт работы с ML или MLOps-системами, опыт оптимизации Spark-приложений, опыт с Data Quality, metadata или lineage, опыт работы с Kubernetes в production, опыт работы с облачной инфраструктурой, опыт с Grafana, Spark History или похожими инструментами.