Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой, после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
VK разрабатывает крупнейший мессенджер в России, который соединяет людей, сервисы и компании. MAX — цифровая платформа с мессенджером, мини-приложениями, нейропомощником, платёжным сервисом и конструктором чат-ботов.
задачи
Развивать и сопровождать инфраструктуру highload-системы, повышать надёжность, доступность и производительность;
Внедрять и поддерживать SLO/SLI и практики error budget, выстраивать алертинг на основе пользовательских метрик и приоритизации;
Развивать observability: Prometheus/Alertmanager, Grafana и централизованные логи, создавать эксплуатационные дашборды, настраивать алерты, снижать alert noise, улучшать MTTD/MTTR;
Автоматизировать рутинные операции и эксплуатационные процессы, снижать toil, развивать self-service-подходы для команд разработки;
Участвовать в on-call, оперативно реагировать на инциденты, координировать восстановление, проводить postmortem и доводить улучшения до продакшена;
Взаимодействовать с командами разработки и инфраструктурными командами, участвовать в архитектурных обсуждениях, ревью изменений и согласовании требований к production readiness;
Вести и развивать эксплуатационную документацию: runbooks/playbooks, инструкции по релизам, роллбэкам и аварийным процедурам, документацию дашбордов, алертов, зависимостей и эскалаций.
требования
Опыт 5+ лет в SRE, DevOps, Platform или System Engineering;
Опыт эксплуатации highload-систем;
Глубокие знания Linux: администрирование, диагностика производительности, systemd, файловые системы, лимиты, квоты и устранение проблем на продакшене;
Знание TCP/IP, DNS, HTTP/HTTPS, TLS, L4/L7-балансировки и keepalive;
Опыт эксплуатации распределённых систем;
Опыт эксплуатации инфраструктуры в публичном облаке: сети, балансировщики, autoscaling, IAM, отказоустойчивость по зонам и регионам, базовые подходы к DR;
Практический опыт работы с Kubernetes на уровне эксплуатации;
Опыт работы с Terraform или аналогом, Ansible, Git workflow и code review;
Знание CI/CD, безопасных релизов, canary, blue-green и стратегий rollback;
Умение читать код на Go, Java или Python для диагностики;
Умение писать автоматизацию на Python, Go или Bash;
Знание Prometheus/Alertmanager, Grafana и централизованных логов;
Знание SRE-практик: SLI/SLO, error budget, incident response и postmortem;
Готовность участвовать в on-call и разборе инцидентов;
Навыки создания и поддержки эксплуатационной документации;
Будет плюсом опыт с PostgreSQL, Redis, Cassandra, Kafka или ClickHouse, сопровождение Java, знание JVM/GC, heap/thread dumps, профилирования, диагностики latency, secrets management и least privilege.