Команда развивает поисковый сервис, который отвечает на запросы пользователей на естественном языке. Сервис предоставляет GigaChat и другим LLM доступ к актуальной информации из интернета для подготовки точных и свежих ответов.
Инженер данных
подготовьтесь к отклику
ai-инструментыЧтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
задачи
- Проектировать и развивать сквозные пайплайны данных для поисковой платформы: загрузку, пакетную и микропакетную обработку, нормализацию, дедупликацию, лемматизацию, обогащение и подготовку данных к индексации;
- Интегрировать новые источники и мультимодальные данные, обеспечивая корректность, полноту и воспроизводимость загрузки;
- Развивать S3 Data LakeHouse и хранилища данных для векторного, полнотекстового и гибридного поиска;
- Оптимизировать процессы Spark на Kubernetes, включая производительность, стоимость хранения, потребление ресурсов и стабильность выполнения;
- Обеспечивать надёжность пайплайнов: мониторинг, качество данных, диагностику инцидентов и контроль SLA;
- Внедрять CI/CD, тестирование и наблюдаемость для пайплайнов данных;
- Работать вместе с ML-инженерами, бэкенд-разработчиками и аналитиками над улучшением качества поиска.
требования
- От 3 лет опыта в роли Data Engineer, ML Engineer или Data Platform Engineer;
- Продвинутый Python и SQL;
- Практический опыт работы с Airflow и Spark/PySpark в production;
- Опыт разработки и оптимизации пакетных или потоковых/микропакетных пайплайнов для больших объёмов данных от 100 TB до PB+;
- Уверенное понимание принципов распределённого хранения данных и распределённых вычислений;
- Опыт анализа производительности заданий Spark: shuffle, skew, partitioning, memory и использование ресурсов;
- Опыт построения или развития высоконагруженных платформ обработки данных;
- Умение проектировать Data LakeHouse или Data Management Platform;
- Опыт работы с Kubernetes и S3-compatible storage;
- Понимание Apache Iceberg и современных форматов данных: Parquet, partitioning, schema evolution и compaction;
- Опыт построения мониторинга, оповещений и CI/CD для пайплайнов данных;
- Будет плюсом опыт работы с поисковыми движками ElasticSearch, OpenSearch и Vespa, Cassandra или другими распределёнными NoSQL-хранилищами, Kafka или другими брокерами событий, задачами vector search, embeddings, ANN/HNSW и hybrid search, GPU-инференсом моделей и PyTorch, облачными платформами AWS, Yandex Cloud и SberCloud, стеком наблюдаемости Prometheus и Grafana.
условия
- Стабильный оклад и премии по результатам работы;
- Ежегодный пересмотр зарплаты;
- Комфортный современный офис рядом с м. Кутузовская;
- Корпоративный спортзал и зоны отдыха;
- Система обучения Сбера для профессионального и карьерного развития;
- Программа адаптации и помощь руководителя на старте;
- Расширенный ДМС и льготное страхование семьи;
- Дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ;
- Бесплатная подписка СберПрайм и скидки на продукты компаний-партнёров;
- Вознаграждение за рекомендацию друзей в команду Сбера;
- Корпоративная пенсионная программа.
навыки
Если просят войти через iCloud, отправить коды из SMS, запустить код, что-то установить, перевести деньги или сделать что угодно, связанное с деньгами, не соглашайтесь: это признаки мошенничества.