Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой — после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда Disrupt в Сбере входит в блок ГенИИ и отвечает за новые воплощения Гиги на рынках: ищет перспективные сценарии, запускает MVP и масштабирует лучшие продукты.
задачи
Запускать и поддерживать распределённый инференс LLM на кластере GPU;
Настраивать движки vLLM, SGLang, TensorRT-LLM или аналоги для максимальной скорости и утилизации оборудования;
Снижать задержки генерации, повышать пропускную способность и эффективно работать с длинным контекстом в MoE-моделях;
Применять квантизацию FP8/INT8, speculative decoding и другие оптимизации без потери качества ответов;
Находить узкие места по памяти VRAM/HBM и сети NVLink/InfiniBand, устранять OOM и сбои узлов;
Упаковывать сервисы в Kubernetes и Docker, настраивать автоскейлинг, выкаты и откаты;
Строить мониторинг метрик вывода: задержек, количества токенов в секунду и стоимости 1 млн токенов;
Проводить нагрузочное тестирование и планировать мощности.
требования
От двух лет опыта в ML Engineering, MLOps или высоконагруженном бэкенде;
Хотя бы один собственный GPU-сервис, доведённый до продакшена;
Уверенное владение Python и Linux;
Знание Docker, Git, CI/CD и базовые навыки работы с Kubernetes;
Практический опыт запуска моделей на PyTorch под NVIDIA GPU;
Опыт работы хотя бы с одним production-стеком для инференса: vLLM, Triton, TensorRT-LLM, SGLang, TGI или аналогами;
Понимание памяти GPU, mixed precision, батчинга, KV-кэша и параллелизма моделей;
Умение измерять производительность, работать с профилировщиками PyTorch Profiler, Nsight и DCGM;
Понимание распределённых систем, таймаутов, повторов запросов, отказоустойчивости при падении узла и выката без простоев;
Будет плюсом умение писать CUDA/Triton kernels, работать с NCCL, NVLink/InfiniBand и GPUDirect/RDMA, опыт запуска MoE-моделей с экспертным параллелизмом и длинным контекстом, знакомство с KServe или Ray Serve, Prometheus/Grafana, GPU Operator или DCGM Exporter, навыки конвертации весов и quantization-aware evaluation, базовые знания C++ или Go.
условия
Комфортный современный офис рядом с м. Кутузовская;
Ежегодный пересмотр зарплаты;
Годовая премия;
Корпоративный спортзал и зоны отдыха;
Система обучения для профессионального и карьерного развития;
Расширенный полис ДМС с первого дня работы и страхование для семьи;
Льготная программа ипотеки для сотрудников;
Бесплатная подписка СберПрайм+ и скидки на продукты компаний-партнёров;
Вознаграждение за рекомендацию друзей в команду Сбера.