сегодня

data engineer Data Mesh

ориентир по рынку
вакансия зп не указана
в среднем 305 643 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовьтесь к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме

описание

Uzum строит экосистему данных по подходу Data Mesh. Домены публикуют данные как data product с точным контрактом, SLA и метриками качества, а платформа предоставляет инструменты для самостоятельного запуска продуктов и автоматически применяет единые правила по контрактам, качеству, доступам, метаданным и стоимости запросов.

задачи

  • Проектировать и строить self-serve платформу с нуля — от подключения источника до опубликованного data product без участия команды платформы;
  • Автоматизировать жизненный цикл контрактов данных: описание схемы, версионирование, проверку обратной совместимости на CI, валидацию данных на проде, генерацию DDL и пайплайнов из контракта;
  • Кастомизировать каталог данных и OpenMetadata под модель компании;
  • Создавать собственные сущности и custom properties, автоматически регистрировать data products, настраивать lineage от источника до витрины и связывать каталог с контрактами, качеством и доступами;
  • Дорабатывать API и UI под внутренние сценарии;
  • Встраивать качество и наблюдаемость в платформу: проверки данных, SLA на data products, алерты, метрики свежести и полноты, контроль стоимости запросов и хранения;
  • Работать с доменами и их командами: разбирать модели данных, проектировать data products, переносить существующие пайплайны на платформу и доводить их до production;
  • Проводить обучение и онбординг доменов: воркшопы, документацию, гайдлайны, разбор типовых ошибок и поддержку команд на первых итерациях;
  • Работать с batch- и streaming-пайплайнами в production-среде.

требования

  • Практический опыт в Data Engineering: Python, SQL, оркестрация и production-пайплайны данных;
  • Опыт работы с Airflow или другими оркестраторами;
  • Понимание batch- и streaming-обработки, опыт работы со Spark или PySpark;
  • Опыт работы с lakehouse- и аналитическим стеком: Trino/Presto, ClickHouse, Iceberg/Parquet/DeltaLake;
  • Опыт с Kafka, Kafka Connect, Debezium или другими инструментами потоковой обработки событий;
  • Опыт разработки внутренних инструментов и сервисов, а не только пайплайнов: чистый код, тесты, CI/CD, Kubernetes;
  • Инженерное мышление и умение учитывать надёжность, стоимость, качество данных, поддержку и влияние изменений на пользователей;
  • Умение работать с внутренними пользователями: собирать требования у домена, объяснять решения, проводить обучение и писать документацию;
  • Будет плюсом опыт с data contracts, каталогами данных, фреймворками качества данных, dbt, а также участие во внедрении Data Mesh или похожей децентрализованной модели.

условия

  • Участие в проектировании платформы, контрактов, автоматизации и governance с нуля;
  • Широкая зона ответственности и возможность влиять на архитектурные решения, платформенные подходы и работу команд с данными;
  • Современный стек: PySpark, Airflow, ClickHouse, Trino, PostgreSQL, Kafka Connect, Debezium, Kubernetes, Iceberg, dbt, OpenMetadata;
  • Понятные цели, production-подход, ответственность за результат и прозрачная коммуникация;
  • Возможность влиять на бизнес, пользователей данных и скорость работы продуктовых команд;
  • Работа в команде сильных специалистов.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Вакансия находится в архиве
и больше не принимает отклики