SRE-инженер (инженер-разработчик по надёжности и эксплуатации)
ориентир по рынку
вакансия
зп не указана
в среднем
337 338 ₽
мэтч
Загрузи резюме, чтобы видеть мэтчи с вакансией
подготовься к отклику
ai-инструменты
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузи резюме
О рекламодателе
ОБЩЕСТВО С ОГРАНИЧЕННОЙ ОТВЕТСТВЕННОСТЬЮ "ЦЕНТР НАЦИОНАЛЬНЫХ ИНТЕЛЛЕКТУАЛЬНЫХ СИСТЕМ" ИНН: 9704271170
описание
2ГИС — технологическая компания и часть экосистемы Сбера. Её сервисами ежедневно пользуются миллионы людей. Компания создаёт выделенную SRE-команду — центр экспертизы по надёжности сервисов, который помогает перейти от реагирования на инциденты к системному управлению доступностью, снизить операционные риски и сделать разработку более предсказуемой.
задачи
Развивать единый процесс управления инцидентами
Формировать культуру разборов postmortem без поиска виноватых
Контролировать выполнение задач по предотвращению повторных сбоев
Улучшать матрицу эскалаций и устранять неоднозначности в процессе реагирования
Стандартизировать внедрение OpenTelemetry для трассировок, метрик и логов
Участвовать в создании единой платформы мониторинга и визуализации
Разрабатывать стандарты логирования
Контролировать объём и качество данных в системах телеметрии
Проводить аудит алертов и снижать число ложных срабатываний
Формировать принципы приоритизации алертов с учётом критичности сервисов
Помогать командам настраивать полезные, своевременные и понятные уведомления
Участвовать в классификации сервисов по уровням критичности: MC, BC, BO, OP
Помогать командам определять и внедрять SLO/SLA
Создавать дашборды для контроля Error Budget
Разрабатывать и поддерживать инструкции, сокращающие время восстановления сервисов
Консультировать продуктовые команды по стабильности и надёжности
Формировать требования к развитию платформы дежурств и интеллектуальной эскалации
Внедрять практики безопасных релизов: canary deployment, автоматический откат изменений и другие подходы к снижению рисков
требования
Опыт работы в SRE или DevOps от 3 лет
Понимание принципов SRE: SLO, SLA, Error Budget, управления инцидентами и наблюдаемости
Практический опыт работы с системами мониторинга и алертинга, например Prometheus и Grafana
Опыт работы с OpenTelemetry или аналогичными инструментами
Навыки автоматизации процессов на Python, Go, Bash или другом языке
Понимание принципов работы дежурств и систем управления инцидентами
Умение анализировать метрики производительности, находить первопричины сбоев и предлагать устойчивые решения
Знакомство с CI/CD, Kubernetes и контейнеризацией
Будет плюсом: опыт внедрения SRE-практик с нуля или их масштабирования, проведения семинаров, обучения или наставничества продуктовых команд по вопросам надёжности
условия
ИТ-аккредитация
Возможность стать одним из первых участников нового стратегического направления и влиять на его развитие
Масштабные технические задачи по обеспечению стабильности сервисов, которыми пользуются миллионы людей
Возможность влиять на процессы и сделать реагирование на инциденты и релизы более предсказуемыми
Возможность участвовать в выборе подходов, стандартов и инструментов
Удалённая работа по РФ или гибрид в Новосибирске, Москве и Санкт-Петербурге
Российская платформа с картами и справочником. Помогает находить организации, строить маршруты, изучать города. Предлагает сервисы для бизнеса: реклама, аналитика, API. Удобно для навигации и поиска услуг.