28 сен

SRE-инженер (инженер-разработчик по надёжности и эксплуатации)

ориентир по рынку
вакансия зп не указана
в среднем 337 338 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовься к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузи резюме

Рекламный баннер: ОБЩЕСТВО С ОГРАНИЧЕННОЙ ОТВЕТСТВЕННОСТЬЮ "ЦЕНТР НАЦИОНАЛЬНЫХ ИНТЕЛЛЕКТУАЛЬНЫХ СИСТЕМ"
О рекламодателе
ОБЩЕСТВО С ОГРАНИЧЕННОЙ ОТВЕТСТВЕННОСТЬЮ "ЦЕНТР НАЦИОНАЛЬНЫХ ИНТЕЛЛЕКТУАЛЬНЫХ СИСТЕМ"
ИНН: 9704271170

описание

2ГИС — технологическая компания и часть экосистемы Сбера. Её сервисами ежедневно пользуются миллионы людей. Компания создаёт выделенную SRE-команду — центр экспертизы по надёжности сервисов, который помогает перейти от реагирования на инциденты к системному управлению доступностью, снизить операционные риски и сделать разработку более предсказуемой.

задачи

  • Развивать единый процесс управления инцидентами
  • Формировать культуру разборов postmortem без поиска виноватых
  • Контролировать выполнение задач по предотвращению повторных сбоев
  • Улучшать матрицу эскалаций и устранять неоднозначности в процессе реагирования
  • Стандартизировать внедрение OpenTelemetry для трассировок, метрик и логов
  • Участвовать в создании единой платформы мониторинга и визуализации
  • Разрабатывать стандарты логирования
  • Контролировать объём и качество данных в системах телеметрии
  • Проводить аудит алертов и снижать число ложных срабатываний
  • Формировать принципы приоритизации алертов с учётом критичности сервисов
  • Помогать командам настраивать полезные, своевременные и понятные уведомления
  • Участвовать в классификации сервисов по уровням критичности: MC, BC, BO, OP
  • Помогать командам определять и внедрять SLO/SLA
  • Создавать дашборды для контроля Error Budget
  • Разрабатывать и поддерживать инструкции, сокращающие время восстановления сервисов
  • Консультировать продуктовые команды по стабильности и надёжности
  • Формировать требования к развитию платформы дежурств и интеллектуальной эскалации
  • Внедрять практики безопасных релизов: canary deployment, автоматический откат изменений и другие подходы к снижению рисков

требования

  • Опыт работы в SRE или DevOps от 3 лет
  • Понимание принципов SRE: SLO, SLA, Error Budget, управления инцидентами и наблюдаемости
  • Практический опыт работы с системами мониторинга и алертинга, например Prometheus и Grafana
  • Опыт работы с OpenTelemetry или аналогичными инструментами
  • Навыки автоматизации процессов на Python, Go, Bash или другом языке
  • Понимание принципов работы дежурств и систем управления инцидентами
  • Умение анализировать метрики производительности, находить первопричины сбоев и предлагать устойчивые решения
  • Знакомство с CI/CD, Kubernetes и контейнеризацией
  • Будет плюсом: опыт внедрения SRE-практик с нуля или их масштабирования, проведения семинаров, обучения или наставничества продуктовых команд по вопросам надёжности

условия

  • ИТ-аккредитация
  • Возможность стать одним из первых участников нового стратегического направления и влиять на его развитие
  • Масштабные технические задачи по обеспечению стабильности сервисов, которыми пользуются миллионы людей
  • Возможность влиять на процессы и сделать реагирование на инциденты и релизы более предсказуемыми
  • Возможность участвовать в выборе подходов, стандартов и инструментов
  • Удалённая работа по РФ или гибрид в Новосибирске, Москве и Санкт-Петербурге

Российская платформа с картами и справочником. Помогает находить организации, строить маршруты, изучать города. Предлагает сервисы для бизнеса: реклама, аналитика, API. Удобно для навигации и поиска услуг.

Подробнее о компании →

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайся: это мошенничество.

Спроси Хайрика про вакансию

Сверит с твоим резюме, подскажет вилку и вопросы на собесе.

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайся: это мошенничество.