19 авг

дата инженер единого хранилища данных

выше рынка на 111,4%
вакансия 540 000 ₽
в среднем 255 465 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовьтесь к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме

описание

Команда строит единое хранилище данных блока B2C — централизованное эталонное место хранения данных. Платформа развивается в направлении Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink, с использованием крупных распределённых систем, потоковой обработки и экосистемы Hadoop.

задачи

  • Разрабатывать и оптимизировать витрины данных;
  • Проектировать и реализовывать эффективные ETL- и ELT-процессы с использованием Apache Spark и Greenplum;
  • Обеспечивать высокую производительность и отказоустойчивость пайплайнов;
  • Поддерживать и развивать пайплайны обработки данных на Hadoop с использованием Apache Spark;
  • Разрабатывать предложения по развитию Data Lakehouse;
  • Внедрять практики работы с Apache Iceberg, включая оптимизацию партиционирования, compaction и time travel;
  • Реализовывать механизмы инкрементальной загрузки данных;
  • Разрабатывать и документировать API на Java или Scala для доступа к данным витрин и сервисам семантического слоя;
  • Оптимизировать Spark-приложения, включая использование векторного движка Gluten/Velox;
  • Разрабатывать решения для сверки и контроля качества данных с использованием Spark и Python;
  • Внедрять разработанные решения в продуктовую среду;
  • Настраивать пайплайны сборки и деплоя в Jenkins;
  • Управлять зависимостями задач в Oozie или современных оркестраторах;
  • Взаимодействовать с внутренними бизнес-заказчиками для уточнения и согласования требований;
  • Презентовать доработки сервиса.

требования

  • Уверенно владеть SQL, Java или Scala, Python;
  • Глубоко понимать экосистему Apache Hadoop, включая HDFS и YARN, и иметь опыт работы с ней в продакшене;
  • Иметь опыт разработки пайплайнов на Apache Spark Core, SQL и Structured Streaming не ниже middle;
  • Понимать форматы хранения данных Parquet, ORC и Avro;
  • Знать современные подходы к управлению Data Lakehouse и Apache Iceberg;
  • Иметь опыт оптимизации производительности Apache Spark: настройка ресурсов, устранение перекосов данных, работа с памятью и оптимизация shuffle;
  • Будет плюсом опыт внедрения промышленных пайплайнов пакетной передачи данных, опыт внедрения Gluten/Velox или аналогичных векторизованных движков, навыки сборки и развёртывания Docker-образов приложений.

условия

  • Офис рядом с метро Кутузовская;
  • Корпоративный спортзал и зоны отдыха;
  • Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития;
  • Регулярные митапы и развитое DS-сообщество;
  • Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа;
  • Дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ;
  • Подписка Прайм с возможностью совместного использования на трёх близких;
  • Вознаграждение за рекомендацию друзей в команду Сбер.

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.