системный инженер платформы наблюдаемости
ориентир по рынку
вакансия
зп не указана
в среднем
351 041 ₽
мэтч
Загрузи резюме, чтобы видеть мэтчи с вакансией
Загрузить
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
загрузить резюме
описание
Cloud.ru развивает платформу мониторинга, наблюдаемости и эксплуатации инфраструктуры.
задачи
Участвовать в продуктовой RUN-команде; Формировать требования к данным и метрикам, внедрять стандарты надёжности данных и лучшие практики наблюдаемости; Анализировать потоки и метрики в Prometheus, Loki, OpenTelemetry и других инструментах; Выявлять отклонения, узкие места и возможности оптимизации; Проверять полноту, корректность и соответствие данных требованиям; Автоматизировать проверки через Quality Gates; Писать и поддерживать автоматические тесты компонентов мониторинга; Проверять наличие и корректность метрик, логов и трассировок после деплоя; Планировать тесты надёжности, канарейковые и теневые развёртывания с автоматическим откатом; Проводить нагрузочное тестирование и сравнивать результаты с базовым профилем; Исследовать новые технологии, собирать метрики и готовить рекомендации; Интегрировать Quality Gates в CI/CD; Отслеживать эффективность через SRE-KPIs и публиковать их в дашбордах; Анализировать инциденты, логи, трассировки, метрики и ETL-пайплайны; Документировать причины инцидентов, фиксировать ошибки и предлагать решения; Вести базу знаний, включая отчёты о разборе инцидентов и операционные руководства; Создавать и актуализировать схемы потоков данных, инструкции и описания архитектуры платформы; Улучшать функциональность и производительность внутренней платформы мониторинга; Автоматизировать наблюдаемость и оповещения как код; Интегрировать пороги проверки качества в CI/CD перед деплоем; Готовить обучающие материалы и проводить воркшопы; Способствовать принятию единых практик наблюдаемости.
требования
Уметь создавать отказоустойчивые масштабируемые сервисы; Иметь опыт написания и ревью технической документации; Иметь опыт коммуникации с разработчиками и бизнесом, включая объяснение компромиссов между надёжностью и разработкой функций; Обладать системным мышлением и уметь анализировать сложные сценарии отказа; Уметь выявлять корневые причины и находить способы их устранения; Иметь практический опыт построения и внедрения Quality Gates в CI/CD для управления рисками при развёртывании; Уметь определять SLI и SLO для сервиса без исторических данных о надёжности; Уметь рассчитывать композитные SLO для сервиса, зависящего от более чем 10 микросервисов; Иметь опыт внедрения наблюдаемости как кода и оповещений как кода.
условия
Оклад и годовой бонус; Расширенный ДМС со стоматологией; Компенсация спорта; Штатный терапевт и психолог; Гибкий график работы, пятница — сокращённый рабочий день; Возможность работать удалённо на территории РФ в зависимости от функционала и позиции; Классный офис в Москве и коворкинги в разных городах России; Оформление в соответствии с трудовым законодательством РФ; Индивидуальный план развития и обучение за счёт компании; Возможность вертикального и горизонтального роста; Возможность развиваться как эксперту: выступать на мероприятиях и писать статьи; Профессиональные сообщества и клубы по интересам; Неформальные мероприятия; Материальная помощь при рождении детей и других семейных обстоятельствах; Бонусы за рекомендации кандидатов; Бонусные программы от компаний-партнёров.
Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.
Про зарплаты
Анонимные данные по зарплатам и грейдам. Можно сверить вилку с рынком.
Посмотреть зарплаты
статьи для DevOps-инженеров