Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузи резюме
описание
Команда строит единое хранилище данных блока B2C — централизованное эталонное место хранения данных. Платформа развивается в сторону Data Lakehouse на Apache Iceberg и Data Streamhouse на Kafka и Apache Flink.
задачи
Разрабатывать и оптимизировать витрины данных
Проектировать и реализовывать ETL- и ELT-процессы для витрин данных с Apache Spark и Greenplum
Обеспечивать высокую производительность и отказоустойчивость конвейеров
Разрабатывать и поддерживать потоковые конвейеры
Строить конвейеры обработки данных из Kafka в Apache Iceberg и между потоками Kafka с Apache Flink и Spark Structured Streaming
Участвовать в разработке архитектуры решения потоковой обработки данных Data Streamhouse
Разрабатывать предложения по развитию Data Lakehouse и внедрять лучшие практики работы с Apache Iceberg
Реализовывать механизмы инкрементальной загрузки данных
Разрабатывать и документировать API на Java или Scala для доступа к данным витрин и сервисам семантического слоя
Оптимизировать Spark-приложения, в том числе с помощью векторного движка Gluten/Velox
Разрабатывать решения для сверки и контроля качества данных с Spark и Python
Внедрять решения в продуктовую среду
Настраивать конвейеры сборки и развёртывания в Jenkins, управлять зависимостями задач в Oozie или современных оркестраторах
Уточнять и согласовывать требования с внутренними бизнес-заказчиками, презентовать доработки сервиса
требования
Уверенно владеть SQL, Java или Scala и Python для вспомогательного анализа и контроля качества данных
Глубоко понимать экосистему Apache Hadoop (HDFS, YARN) и иметь опыт работы с ней в промышленной среде
Иметь опыт разработки конвейеров на Apache Spark (Core, SQL, Structured Streaming) не ниже уровня middle
Иметь опыт работы с потоковыми данными, Apache Kafka и Apache Flink или Spark Streaming
Понимать форматы хранения Parquet, ORC, Avro и современные подходы к управлению Data Lakehouse; знать Apache Iceberg
Иметь опыт оптимизации производительности Apache Spark, настройки ресурсов, устранения перекосов данных, работы с памятью и оптимизации shuffle
Будет плюсом: опыт внедрения промышленных конвейеров пакетной и потоковой передачи данных, опыт внедрения Gluten/Velox или аналогичных векторизованных движков, навыки сборки и развёртывания Docker-образов приложений
условия
Годовая премия
Корпоративный спортзал и зоны отдыха
Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
Регулярные митапы и развитое DS-сообщество
Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
Льготный дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
Подписка Прайм с возможностью совместного использования на троих близких
Вознаграждение за рекомендацию друзей в команду Сбера
Крупнейший российский банк и экосистема. Предоставляет банковские услуги: кредиты, вклады, карты, ипотека. Развивает сервисы: доставка, здоровье, развлечения, облачные технологии и ИИ. Удобно для финансов и повседневных задач.