18 сен

инженер доступности highload-систем

ориентир по рынку
вакансия зп не указана
в среднем 328 556 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовьтесь к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме

описание

VK разрабатывает крупнейший мессенджер в России, который соединяет людей, сервисы и компании. MAX — цифровая платформа с мессенджером, мини-приложениями, нейропомощником, платёжным сервисом и конструктором чат-ботов.

задачи

  • Развивать и сопровождать инфраструктуру highload-системы, повышать надёжность, доступность и производительность;
  • Внедрять и поддерживать SLO/SLI и практики error budget, выстраивать алертинг на основе пользовательских метрик и приоритизации;
  • Развивать observability: Prometheus/Alertmanager, Grafana и централизованные логи, создавать эксплуатационные дашборды, настраивать алерты, снижать alert noise, улучшать MTTD/MTTR;
  • Автоматизировать рутинные операции и эксплуатационные процессы, снижать toil, развивать self-service-подходы для команд разработки;
  • Участвовать в on-call, оперативно реагировать на инциденты, координировать восстановление, проводить postmortem и доводить улучшения до продакшена;
  • Взаимодействовать с командами разработки и инфраструктурными командами, участвовать в архитектурных обсуждениях, ревью изменений и согласовании требований к production readiness;
  • Вести и развивать эксплуатационную документацию: runbooks/playbooks, инструкции по релизам, роллбэкам и аварийным процедурам, документацию дашбордов, алертов, зависимостей и эскалаций.

требования

  • Опыт 5+ лет в SRE, DevOps, Platform или System Engineering;
  • Опыт эксплуатации highload-систем;
  • Глубокие знания Linux: администрирование, диагностика производительности, systemd, файловые системы, лимиты, квоты и устранение проблем на продакшене;
  • Знание TCP/IP, DNS, HTTP/HTTPS, TLS, L4/L7-балансировки и keepalive;
  • Опыт эксплуатации распределённых систем;
  • Опыт эксплуатации инфраструктуры в публичном облаке: сети, балансировщики, autoscaling, IAM, отказоустойчивость по зонам и регионам, базовые подходы к DR;
  • Практический опыт работы с Kubernetes на уровне эксплуатации;
  • Опыт работы с Terraform или аналогом, Ansible, Git workflow и code review;
  • Знание CI/CD, безопасных релизов, canary, blue-green и стратегий rollback;
  • Умение читать код на Go, Java или Python для диагностики;
  • Умение писать автоматизацию на Python, Go или Bash;
  • Знание Prometheus/Alertmanager, Grafana и централизованных логов;
  • Знание SRE-практик: SLI/SLO, error budget, incident response и postmortem;
  • Готовность участвовать в on-call и разборе инцидентов;
  • Навыки создания и поддержки эксплуатационной документации;
  • Будет плюсом опыт с PostgreSQL, Redis, Cassandra, Kafka или ClickHouse, сопровождение Java, знание JVM/GC, heap/thread dumps, профилирования, диагностики latency, secrets management и least privilege.

условия

  • Гибкий график работы;
  • Бонусы и скидки от партнёров;
  • Офис в центре города;
  • ДМС;
  • Профессиональная команда.

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.