Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузи резюме
О рекламодателе
ОБЩЕСТВО С ОГРАНИЧЕННОЙ ОТВЕТСТВЕННОСТЬЮ "ЦЕНТР НАЦИОНАЛЬНЫХ ИНТЕЛЛЕКТУАЛЬНЫХ СИСТЕМ" ИНН: 9704271170
описание
При отклике прошу сразу указывать в сопроводительном письме следующий опыт: — опыт именно с Kubernetes и контейнерной инфраструктурой (эксплуатация, автоскейлинг, мониторинг, IaC) - какой проект, сколько лет опыта — опыт с Apache Airflow: архитектура, executor, обработка ошибок, мониторинг DAG, версионирование и деплой- указать проекты, число лет опыта — опыт с обеими СУБД: PostgreSQL (OLTP) и ClickHouse (OLAP), включая репликацию, бэкапы, оптимизацию
Проект связан с эксплуатацией и оптимизацией Kubernetes-кластера и Apache Airflow, а также работой с базами данных PostgreSQL и ClickHouse.
задачи
Эксплуатировать Kubernetes-кластер: обновлять его без простоя, диагностировать поды и управлять постоянным хранилищем
Настраивать автоскейлинг с помощью HPA, VPA и Cluster Autoscaler
Мониторить кластер через Prometheus и встроенные инструменты облака
Управлять Apache Airflow: выбирать исполнитель и развёртывать его в Kubernetes через Helm
Обрабатывать ошибки и настраивать политики повторных попыток в ETL-пайплайнах
Мониторить и оптимизировать DAG, анализировать производительность
Управлять версиями и развёртыванием DAG
Выбирать и оптимизировать СУБД: PostgreSQL для OLTP и ClickHouse для OLAP
Настраивать репликацию и резервное копирование, включая PITR
Оптимизировать производительность баз данных: профилировать запросы, настраивать индексы и партиционирование
Выполнять логическую и физическую миграцию данных
Управлять инфраструктурой через Terraform
Управлять секретами и их ротацией
Диагностировать инциденты и восстанавливать системы
Планировать аварийное восстановление и мощности
требования
Уверенно эксплуатировать Kubernetes-кластеры, включая обновления без простоя, PDB, drain, диагностику подов и постоянное хранилище
Знать автоскейлинг, метрики и пользовательские метрики
Настраивать мониторинг кластера с помощью Prometheus и отслеживать ключевые метрики CPU, памяти, PVC, перезапусков, давления на узлы и задержек API
Владеть Terraform и Helm для Kubernetes, развёртывания кластеров и приложений, модульной настройки и CI/CD для манифестов
Знать архитектуру Apache Airflow, исполнители Local, Celery и Kubernetes, а также развёртывание через Helm
Настраивать политики повторных попыток, экспоненциальную задержку, идемпотентные задачи, DLQ и оповещения при сбоях
Анализировать длительность задач DAG, загрузку пулов, задержки сенсоров и работу отложенных операторов
Настраивать версионирование DAG, GitSync, образы, CI/CD, семантическое версионирование и откат
Разбираться в PostgreSQL для OLTP и ClickHouse для OLAP, распределённых таблицах и движках хранения
Настраивать репликацию и резервное копирование, PITR, RPO/RTO и тестирование восстановления
Профилировать запросы с помощью pg_stat и system.query_log, настраивать индексы, партиционирование и материализованные представления
Выполнять логическую и физическую миграцию данных с DMS-инструментами и минимальным простоем
Настраивать облачную инфраструктуру через Terraform: сети, виртуальные машины и управляемые сервисы
Управлять секретами с помощью Vault, Lockbox и External Secrets, настраивать ротацию и минимальные привилегии
Настраивать метрики, логи, дашборды, SLO/SLI, дежурства и трассировку ETL
Знать подходы Multi-AZ, резервные кластеры и runbook’и
Диагностировать деградацию ETL, восстанавливать планировщик и настраивать blue-green deployment
Обладать аналитическим мышлением для диагностики сложных проблем инфраструктуры
Отвечать за надёжность критичных систем
Быть внимательным к деталям при управлении конфигурациями и миграциями
Уметь взаимодействовать при разборе инцидентов и подготовке runbook’ов
Иметь глубокие знания на уровне Senior по всем указанным направлениям, включая выбор компонентов, понимание их взаимодействия, диагностику и оптимизацию под нагрузкой, проведение тренировок по восстановлению систем