Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой — после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда строит единое хранилище данных блока B2C — централизованное эталонное место хранения данных. Платформа развивается в направлении Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink, с использованием крупных распределённых систем, потоковой обработки и экосистемы Hadoop.
задачи
Разрабатывать и оптимизировать витрины данных;
Проектировать и реализовывать эффективные ETL- и ELT-процессы с использованием Apache Spark и Greenplum;
Обеспечивать высокую производительность и отказоустойчивость пайплайнов;
Поддерживать и развивать пайплайны обработки данных на Hadoop с использованием Apache Spark;
Разрабатывать предложения по развитию Data Lakehouse;
Внедрять практики работы с Apache Iceberg, включая оптимизацию партиционирования, compaction и time travel;
Разрабатывать и документировать API на Java или Scala для доступа к данным витрин и сервисам семантического слоя;
Оптимизировать Spark-приложения, включая использование векторного движка Gluten/Velox;
Разрабатывать решения для сверки и контроля качества данных с использованием Spark и Python;
Внедрять разработанные решения в продуктовую среду;
Настраивать пайплайны сборки и деплоя в Jenkins;
Управлять зависимостями задач в Oozie или современных оркестраторах;
Взаимодействовать с внутренними бизнес-заказчиками для уточнения и согласования требований;
Презентовать доработки сервиса.
требования
Уверенно владеть SQL, Java или Scala, Python;
Глубоко понимать экосистему Apache Hadoop, включая HDFS и YARN, и иметь опыт работы с ней в продакшене;
Иметь опыт разработки пайплайнов на Apache Spark Core, SQL и Structured Streaming не ниже middle;
Понимать форматы хранения данных Parquet, ORC и Avro;
Знать современные подходы к управлению Data Lakehouse и Apache Iceberg;
Иметь опыт оптимизации производительности Apache Spark: настройка ресурсов, устранение перекосов данных, работа с памятью и оптимизация shuffle;
Будет плюсом опыт внедрения промышленных пайплайнов пакетной передачи данных, опыт внедрения Gluten/Velox или аналогичных векторизованных движков, навыки сборки и развёртывания Docker-образов приложений.
условия
Офис рядом с метро Кутузовская;
Корпоративный спортзал и зоны отдыха;
Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития;
Регулярные митапы и развитое DS-сообщество;
Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа;
Дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ;
Подписка Прайм с возможностью совместного использования на трёх близких;
Вознаграждение за рекомендацию друзей в команду Сбер.