сегодня

data engineer хранилища B2C

выше рынка на 43,4%
вакансия 500 000 ₽
в среднем 348 719 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовься к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузи резюме

описание

Команда строит единое хранилище данных блока B2C — централизованное эталонное место хранения данных. Платформа развивается в сторону Data Lakehouse на Apache Iceberg и Data Streamhouse на Kafka и Apache Flink.

задачи

  • Разрабатывать и оптимизировать витрины данных
  • Проектировать и реализовывать ETL- и ELT-процессы для витрин данных с Apache Spark и Greenplum
  • Обеспечивать высокую производительность и отказоустойчивость конвейеров
  • Разрабатывать и поддерживать потоковые конвейеры
  • Строить конвейеры обработки данных из Kafka в Apache Iceberg и между потоками Kafka с Apache Flink и Spark Structured Streaming
  • Участвовать в разработке архитектуры решения потоковой обработки данных Data Streamhouse
  • Разрабатывать предложения по развитию Data Lakehouse и внедрять лучшие практики работы с Apache Iceberg
  • Реализовывать механизмы инкрементальной загрузки данных
  • Разрабатывать и документировать API на Java или Scala для доступа к данным витрин и сервисам семантического слоя
  • Оптимизировать Spark-приложения, в том числе с помощью векторного движка Gluten/Velox
  • Разрабатывать решения для сверки и контроля качества данных с Spark и Python
  • Внедрять решения в продуктовую среду
  • Настраивать конвейеры сборки и развёртывания в Jenkins, управлять зависимостями задач в Oozie или современных оркестраторах
  • Уточнять и согласовывать требования с внутренними бизнес-заказчиками, презентовать доработки сервиса

требования

  • Уверенно владеть SQL, Java или Scala и Python для вспомогательного анализа и контроля качества данных
  • Глубоко понимать экосистему Apache Hadoop (HDFS, YARN) и иметь опыт работы с ней в промышленной среде
  • Иметь опыт разработки конвейеров на Apache Spark (Core, SQL, Structured Streaming) не ниже уровня middle
  • Иметь опыт работы с потоковыми данными, Apache Kafka и Apache Flink или Spark Streaming
  • Понимать форматы хранения Parquet, ORC, Avro и современные подходы к управлению Data Lakehouse; знать Apache Iceberg
  • Иметь опыт оптимизации производительности Apache Spark, настройки ресурсов, устранения перекосов данных, работы с памятью и оптимизации shuffle
  • Будет плюсом: опыт внедрения промышленных конвейеров пакетной и потоковой передачи данных, опыт внедрения Gluten/Velox или аналогичных векторизованных движков, навыки сборки и развёртывания Docker-образов приложений

условия

  • Годовая премия
  • Корпоративный спортзал и зоны отдыха
  • Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • Регулярные митапы и развитое DS-сообщество
  • Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • Льготный дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • Подписка Прайм с возможностью совместного использования на троих близких
  • Вознаграждение за рекомендацию друзей в команду Сбера

Крупнейший российский банк и экосистема. Предоставляет банковские услуги: кредиты, вклады, карты, ипотека. Развивает сервисы: доставка, здоровье, развлечения, облачные технологии и ИИ. Удобно для финансов и повседневных задач.

Подробнее о компании →

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайся: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайся: это мошенничество.