Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой, после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда больших языковых моделей и машинного обучения строит платформу распределённых вычислений, объединяющую CPU, GPU и другие вычислительные ресурсы в единую инфраструктуру для ML-задач.
задачи
Проектировать и с нуля строить распределённую вычислительную платформу примерно на 1000 машин;
Развивать инфраструктуру на Kubernetes и Nomad для запуска и управления ML-нагрузками;
Работать с GPU-кластерами и вычислительными ресурсами разных типов: GPU, CPU, MPS;
Развивать распределённые вычисления на Ray и инфраструктуру для распределённого обучения;
Автоматизировать размещение и запуск задач, управление ресурсами и их загрузкой;
Масштабировать инфраструктуру, повышать производительность и отказоустойчивость;
Развивать CI/CD и мониторинг;
Тесно работать с ML-командой над инфраструктурой для обучения и запуска нейросетей.
требования
От 3–5 лет опыта в DevOps, MLOps или Platform Engineering;
Уверенное владение Kubernetes и/или Nomad;
Опыт работы с большими промышленными кластерами и распределёнными системами;
Практический опыт работы с GPU-инфраструктурой;
Понимание обучения нейросетей и распределённого обучения;
Опыт работы с Docker, Docker Registry, CI/CD, Linux и мониторингом;
Опыт проектирования и создания инфраструктуры с нуля;
Будет плюсом опыт с HPC, суперкомпьютерами, GPU-фермами, Ray и крупными вычислительными кластерами.