devops инженер вычислительных кластеров для AI-нагрузок
ориентир по рынку
вакансия
зп не указана
в среднем
353 643 ₽
мэтч
Загрузи резюме, чтобы видеть мэтчи с вакансией
подготовься к отклику
ai-инструменты
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузи резюме
О рекламодателе
ОБЩЕСТВО С ОГРАНИЧЕННОЙ ОТВЕТСТВЕННОСТЬЮ "ЦЕНТР НАЦИОНАЛЬНЫХ ИНТЕЛЛЕКТУАЛЬНЫХ СИСТЕМ" ИНН: 9704271170
описание
Описания нет
задачи
Участвовать в проектировании архитектуры вычислительных кластеров для AI-нагрузок;
Автоматизировать подготовку, конфигурацию и жизненный цикл bare-metal-серверов;
Развивать инфраструктуру виртуализации и процессы предоставления виртуальных машин;
Развертывать и сопровождать Kubernetes-кластеры на физических и виртуальных узлах;
Настраивать сетевую связность, сегментацию, маршрутизацию, балансировку и доступ к инфраструктурным сервисам;
Интегрировать GPU и другие ускорители: драйверы, device plugins, операторы и средства мониторинга;
Участвовать в проектировании и эксплуатации хранилищ для весов моделей, датасетов и кешей;
Развивать Infrastructure as Code, GitOps и автоматизированные процессы изменения инфраструктуры;
Создавать CI/CD-процессы для инфраструктурного кода, образов ОС и базовых компонентов кластеров;
Настраивать мониторинг оборудования, сети, ОС, виртуализации, Kubernetes и ускорителей;
Проводить планирование мощности, анализировать утилизацию и находить инфраструктурные узкие места;
Проектировать отказоустойчивость, резервирование и восстановление после сбоев;
Стабилизировать платформу, участвовать в расследовании инцидентов и устранять их первопричины;
Готовить типовые инфраструктурные конфигурации для облака и локальных установок;
Оценивать и внедрять подходящие решения с открытым исходным кодом и коммерческие инфраструктурные решения;
Координировать изменения с владельцами дата-центров, сетей, информационной безопасности и продуктовыми командами.
требования
Опыт эксплуатации Linux-инфраструктуры в промышленной среде;
Глубокое понимание модели OSI, TCP/IP, DNS, VLAN, маршрутизации и балансировки;
Опыт работы с bare-metal-серверами и автоматизацией их подготовки;
Опыт эксплуатации одной или нескольких платформ виртуализации;
Уверенное знание Kubernetes и принципов устройства контейнерной инфраструктуры;
Опыт написания скриптов и инструментов автоматизации на Bash, Python или Go;
Опыт применения Ansible и Terraform либо аналогичных средств Infrastructure as Code;
Практический опыт построения CI/CD для инфраструктурных изменений;
Опыт настройки мониторинга оборудования, ОС и сетевых компонентов;
Понимание принципов работы распределённых хранилищ и требований к производительности ввода-вывода;
Опыт работы с Git и проверки кода;
Знание принципов высокой доступности, резервирования и восстановления после сбоев;
Системный подход к диагностике сложных инфраструктурных проблем;
Будет плюсом опыт построения или эксплуатации GPU/HPC-кластеров, знание RDMA, InfiniBand, RoCE или других высокоскоростных сетевых технологий, опыт работы с NVIDIA GPU Operator, DCGM, MIG и драйверами ускорителей, опыт эксплуатации Ceph, S3-совместимых или параллельных файловых систем, опыт работы с OpenStack, KVM, VMware или аналогичными платформами, опыт эксплуатации инфраструктуры в изолированных локальных контурах, понимание профиля нагрузки LLM inference и обучения моделей.
Российский облачный провайдер, предлагающий виртуальные машины, управляемые базы данных, хранилище S3, Kubernetes и AI-платформу на базе собственных суперкомпьютеров, обеспечивает бесплатную миграцию, масштабирование инфраструктуры и экспертную поддержку бизнес-процессов