18 авг

системный инженер платформы наблюдаемости

ориентир по рынку
вакансия зп не указана
в среднем 351 041 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовьтесь к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме

описание

Cloud.ru развивает платформу мониторинга, наблюдаемости и эксплуатации инфраструктуры.

задачи

  • Участвовать в продуктовой RUN-команде;
  • Формировать требования к данным и метрикам, внедрять стандарты надёжности данных и лучшие практики наблюдаемости;
  • Анализировать потоки и метрики в Prometheus, Loki, OpenTelemetry и других инструментах;
  • Выявлять отклонения, узкие места и возможности оптимизации;
  • Проверять полноту, корректность и соответствие данных требованиям;
  • Автоматизировать проверки через Quality Gates;
  • Писать и поддерживать автоматические тесты компонентов мониторинга;
  • Проверять наличие и корректность метрик, логов и трассировок после деплоя;
  • Планировать тесты надёжности, канарейковые и теневые развёртывания с автоматическим откатом;
  • Проводить нагрузочное тестирование и сравнивать результаты с базовым профилем;
  • Исследовать новые технологии, собирать метрики и готовить рекомендации;
  • Интегрировать Quality Gates в CI/CD;
  • Отслеживать эффективность через SRE-KPIs и публиковать их в дашбордах;
  • Анализировать инциденты, логи, трассировки, метрики и ETL-пайплайны;
  • Документировать причины инцидентов, фиксировать ошибки и предлагать решения;
  • Вести базу знаний, включая отчёты о разборе инцидентов и операционные руководства;
  • Создавать и актуализировать схемы потоков данных, инструкции и описания архитектуры платформы;
  • Улучшать функциональность и производительность внутренней платформы мониторинга;
  • Автоматизировать наблюдаемость и оповещения как код;
  • Интегрировать пороги проверки качества в CI/CD перед деплоем;
  • Готовить обучающие материалы и проводить воркшопы;
  • Способствовать принятию единых практик наблюдаемости.

требования

  • Уметь создавать отказоустойчивые масштабируемые сервисы;
  • Иметь опыт написания и ревью технической документации;
  • Иметь опыт коммуникации с разработчиками и бизнесом, включая объяснение компромиссов между надёжностью и разработкой функций;
  • Обладать системным мышлением и уметь анализировать сложные сценарии отказа;
  • Уметь выявлять корневые причины и находить способы их устранения;
  • Иметь практический опыт построения и внедрения Quality Gates в CI/CD для управления рисками при развёртывании;
  • Уметь определять SLI и SLO для сервиса без исторических данных о надёжности;
  • Уметь рассчитывать композитные SLO для сервиса, зависящего от более чем 10 микросервисов;
  • Иметь опыт внедрения наблюдаемости как кода и оповещений как кода.

условия

  • Оклад и годовой бонус;
  • Расширенный ДМС со стоматологией;
  • Компенсация спорта;
  • Штатный терапевт и психолог;
  • Гибкий график работы, пятница — сокращённый рабочий день;
  • Возможность работать удалённо на территории РФ в зависимости от функционала и позиции;
  • Классный офис в Москве и коворкинги в разных городах России;
  • Оформление в соответствии с трудовым законодательством РФ;
  • Индивидуальный план развития и обучение за счёт компании;
  • Возможность вертикального и горизонтального роста;
  • Возможность развиваться как эксперту: выступать на мероприятиях и писать статьи;
  • Профессиональные сообщества и клубы по интересам;
  • Неформальные мероприятия;
  • Материальная помощь при рождении детей и других семейных обстоятельствах;
  • Бонусы за рекомендации кандидатов;
  • Бонусные программы от компаний-партнёров.

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.