sre инженер AI-сервисов

ориентир по рынку
вакансия зп не указана
в среднем 218 868 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовьтесь к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме

описание

Фантех — бизнес-юнит Яндекса, развивающий развлекательные онлайн-сервисы Яндекс Плюса: Кинопоиск, Музыку, Яндекс Афишу, Книги и другие продукты. Команда создаёт технологии, которые помогают пользователям находить интересный контент, а также разрабатывает AI-продукты, включая AI-собеседника Люмена для рекомендаций и общения о кино, музыке и книгах.

задачи

  • Обеспечивать надёжность AI-сервисов, следить за их состоянием, участвовать в дежурствах, диагностировать нештатные ситуации и устранять их причины;
  • Улучшать мониторинг, логирование и алертинг;
  • Определять критичные показатели сервисов и внедрять практики SLI, SLO и error budget;
  • Проектировать инфраструктуру новых микросервисов вместе с разработчиками;
  • Настраивать развёртывание новых компонентов и их интеграцию с общей платформой;
  • Писать инструменты на Python;
  • Развивать CI/CD;
  • Автоматизировать создание и настройку инфраструктуры;
  • Участвовать в проектировании отказоустойчивых решений;
  • Разбирать инциденты;
  • Помогать команде улучшать процессы разработки и эксплуатации.

требования

  • Опыт работы с Linux или другими Unix-системами и диагностики системных проблем;
  • Знание сетевых протоколов, DNS, HTTP, балансировки и маршрутизации;
  • Умение строить мониторинг, анализировать логи и настраивать полезные алерты;
  • Навыки программирования на Python для автоматизации инфраструктурных задач;
  • Опыт работы с Kubernetes, Terraform, Ansible или аналогичными системами оркестрации и Infrastructure as Code;
  • Понимание CI/CD и пути изменения от кода до эксплуатации в продакшене;
  • Опыт работы с облачной инфраструктурой;
  • Умение работать с базами данных, очередями и кешами;
  • Понимание принципов построения отказоустойчивых распределённых систем;
  • Знание SLI и SLO и готовность участвовать в развитии этих практик;
  • Готовность участвовать в дежурствах и сопровождать критичные сервисы;
  • Умение обсуждать инфраструктурные и архитектурные решения с разработчиками;
  • Будет плюсом опыт эксплуатации высоконагруженных систем и capacity planning, внедрения SLI, SLO и error budget, обеспечения надёжности сервисов с LLM или внешними API, наблюдаемости и диагностики AI-систем, нагрузочного тестирования и оптимизации производительности сервисов.

условия

  • Расширенная медицинская страховка с первого месяца работы;
  • 30 Оплачиваемых дней больничного в году;
  • ДМС покрывает чекапы, вакцинацию, стоматологию и коррекцию зрения после года работы;
  • Оплата ведения беременности и родов для сотрудниц и жён сотрудников, работающих более двух лет;
  • ДМС для детей и супругов по системе 80/20.

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.