7 авг

Инженер данных

ориентир по рынку
вакансия зп не указана
в среднем 304 894 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовьтесь к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме

описание

Команда развивает поисковый сервис, который отвечает на запросы пользователей на естественном языке. Сервис предоставляет GigaChat и другим LLM доступ к актуальной информации из интернета для подготовки точных и свежих ответов.

задачи

  • Проектировать и развивать сквозные пайплайны данных для поисковой платформы: загрузку, пакетную и микропакетную обработку, нормализацию, дедупликацию, лемматизацию, обогащение и подготовку данных к индексации;
  • Интегрировать новые источники и мультимодальные данные, обеспечивая корректность, полноту и воспроизводимость загрузки;
  • Развивать S3 Data LakeHouse и хранилища данных для векторного, полнотекстового и гибридного поиска;
  • Оптимизировать процессы Spark на Kubernetes, включая производительность, стоимость хранения, потребление ресурсов и стабильность выполнения;
  • Обеспечивать надёжность пайплайнов: мониторинг, качество данных, диагностику инцидентов и контроль SLA;
  • Внедрять CI/CD, тестирование и наблюдаемость для пайплайнов данных;
  • Работать вместе с ML-инженерами, бэкенд-разработчиками и аналитиками над улучшением качества поиска.

требования

  • От 3 лет опыта в роли Data Engineer, ML Engineer или Data Platform Engineer;
  • Продвинутый Python и SQL;
  • Практический опыт работы с Airflow и Spark/PySpark в production;
  • Опыт разработки и оптимизации пакетных или потоковых/микропакетных пайплайнов для больших объёмов данных от 100 TB до PB+;
  • Уверенное понимание принципов распределённого хранения данных и распределённых вычислений;
  • Опыт анализа производительности заданий Spark: shuffle, skew, partitioning, memory и использование ресурсов;
  • Опыт построения или развития высоконагруженных платформ обработки данных;
  • Умение проектировать Data LakeHouse или Data Management Platform;
  • Опыт работы с Kubernetes и S3-compatible storage;
  • Понимание Apache Iceberg и современных форматов данных: Parquet, partitioning, schema evolution и compaction;
  • Опыт построения мониторинга, оповещений и CI/CD для пайплайнов данных;
  • Будет плюсом опыт работы с поисковыми движками ElasticSearch, OpenSearch и Vespa, Cassandra или другими распределёнными NoSQL-хранилищами, Kafka или другими брокерами событий, задачами vector search, embeddings, ANN/HNSW и hybrid search, GPU-инференсом моделей и PyTorch, облачными платформами AWS, Yandex Cloud и SberCloud, стеком наблюдаемости Prometheus и Grafana.

условия

  • Стабильный оклад и премии по результатам работы;
  • Ежегодный пересмотр зарплаты;
  • Комфортный современный офис рядом с м. Кутузовская;
  • Корпоративный спортзал и зоны отдыха;
  • Система обучения Сбера для профессионального и карьерного развития;
  • Программа адаптации и помощь руководителя на старте;
  • Расширенный ДМС и льготное страхование семьи;
  • Дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ;
  • Бесплатная подписка СберПрайм и скидки на продукты компаний-партнёров;
  • Вознаграждение за рекомендацию друзей в команду Сбера;
  • Корпоративная пенсионная программа.

Если просят войти через iCloud, отправить коды из SMS, запустить код, что-то установить, перевести деньги или сделать что угодно, связанное с деньгами, не соглашайтесь: это признаки мошенничества.

прозрачные зарплаты в IT

Анонимные данные по зарплатам и грейдам

Посмотреть
График динамики зарплат
Откликнуться Добавить в трекер

Если просят войти через iCloud, отправить коды из SMS, запустить код, что-то установить, перевести деньги или сделать что угодно, связанное с деньгами, не соглашайтесь: это признаки мошенничества.