Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой, после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Платформа искусственного интеллекта обеспечивает работу вычислительных ресурсов, микросервисов и системного программного обеспечения в средах с применением графических ускорителей.
задачи
Обеспечивать отказоустойчивость платформы искусственного интеллекта;
Формировать планы аварийных переключений;
Применять технологии для обеспечения отказоустойчивой работы;
Анализировать метрики производительности;
Проводить анализ причин инцидентов и ошибок работы платформы искусственного интеллекта;
Разрабатывать меры по недопущению повторения сбоев;
Автоматизировать рутинные действия;
Внедрять и применять лучшие практики подхода «инфраструктура как код»;
Участвовать в проектировании и организации вычислительных ресурсов для решения новых функциональных задач и внедрения в эксплуатацию технологий;
Администрировать системное программное обеспечение платформ искусственного интеллекта, включая операционные системы, оркестратор микросервисов, модули управления и мониторинга и другие компоненты.
требования
Опыт сопровождения Kubernetes от 3 лет;
Опыт внедрения кластеров виртуализации, частных и публичных облаков с использованием GPU Nvidia для AI/ML, включая LLM;
Опыт использования и развёртывания Istio, haproxy, opensearch, vector, kafka, victoria metrics, vault, kyverno, calico, Kserve, multus, sriov, rdma, infiniband, patroni, postgresql, multi-tenant k8s, nvidia gpu-operator, network operator, dcgm, grafana, argo workflow и argo cd;
Опыт внедрения и сопровождения систем с использованием сети Infiniband на базе коммутаторов Mellanox;
Понимание работы, тюнинг и настройка OpenSM;
Навыки использования Go и Python для создания скриптов и операторов K8S;
Знание и применение Ansible и Terraform;
Понимание принципов работы NFS и S3;
Будет плюсом опыт работы с NFS и S3.
условия
Квартальная премия по результатам KPI;
Гибкий график работы;
Полная удалёнка или гибрид на выбор;
ИТ-хабы в Москве, Питере и Екатеринбурге;
Сезонный коворкинг в Сочи;
Программа ДМС с первых дней работы, включая стоматологию и обслуживание в лучших клиниках города;
Страхование и компенсация 10 дней больничного;
Тренинги, вебинары, митапы и демо-дни;
Оплата профильных конференций и курсов;
Помощь с подготовкой к публичным выступлениям и написанием статей на Хабр;
Доступ к корпоративным библиотекам Alpina Digital и MyBook;
Спортзалы в Москве, Питере и Екатеринбурге;
Скидки на услуги туристических агентств, продукты питания, рестораны, бары и магазины;