19 авг

devops инженер высоконагруженного инференса

ориентир по рынку
вакансия зп не указана
в среднем 217 766 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовьтесь к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме

описание

Команда Disrupt в Сбере входит в блок ГенИИ и отвечает за новые воплощения Гиги на рынках: ищет перспективные сценарии, запускает MVP и масштабирует лучшие продукты.

задачи

  • Запускать и поддерживать распределённый инференс LLM на кластере GPU;
  • Настраивать движки vLLM, SGLang, TensorRT-LLM или аналоги для максимальной скорости и утилизации оборудования;
  • Снижать задержки генерации, повышать пропускную способность и эффективно работать с длинным контекстом в MoE-моделях;
  • Применять квантизацию FP8/INT8, speculative decoding и другие оптимизации без потери качества ответов;
  • Находить узкие места по памяти VRAM/HBM и сети NVLink/InfiniBand, устранять OOM и сбои узлов;
  • Упаковывать сервисы в Kubernetes и Docker, настраивать автоскейлинг, выкаты и откаты;
  • Строить мониторинг метрик вывода: задержек, количества токенов в секунду и стоимости 1 млн токенов;
  • Проводить нагрузочное тестирование и планировать мощности.

требования

  • От двух лет опыта в ML Engineering, MLOps или высоконагруженном бэкенде;
  • Хотя бы один собственный GPU-сервис, доведённый до продакшена;
  • Уверенное владение Python и Linux;
  • Знание Docker, Git, CI/CD и базовые навыки работы с Kubernetes;
  • Практический опыт запуска моделей на PyTorch под NVIDIA GPU;
  • Опыт работы хотя бы с одним production-стеком для инференса: vLLM, Triton, TensorRT-LLM, SGLang, TGI или аналогами;
  • Понимание памяти GPU, mixed precision, батчинга, KV-кэша и параллелизма моделей;
  • Умение измерять производительность, работать с профилировщиками PyTorch Profiler, Nsight и DCGM;
  • Понимание распределённых систем, таймаутов, повторов запросов, отказоустойчивости при падении узла и выката без простоев;
  • Будет плюсом умение писать CUDA/Triton kernels, работать с NCCL, NVLink/InfiniBand и GPUDirect/RDMA, опыт запуска MoE-моделей с экспертным параллелизмом и длинным контекстом, знакомство с KServe или Ray Serve, Prometheus/Grafana, GPU Operator или DCGM Exporter, навыки конвертации весов и quantization-aware evaluation, базовые знания C++ или Go.

условия

  • Комфортный современный офис рядом с м. Кутузовская;
  • Ежегодный пересмотр зарплаты;
  • Годовая премия;
  • Корпоративный спортзал и зоны отдыха;
  • Система обучения для профессионального и карьерного развития;
  • Расширенный полис ДМС с первого дня работы и страхование для семьи;
  • Льготная программа ипотеки для сотрудников;
  • Бесплатная подписка СберПрайм+ и скидки на продукты компаний-партнёров;
  • Вознаграждение за рекомендацию друзей в команду Сбера.

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.