вчера

ml инженер генеративных моделей

ориентир по рынку
вакансия зп не указана
в среднем 305 486 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовьтесь к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме

описание

Описания нет

задачи

  • Готовить LLM и другие генеративные модели к промышленному запуску;
  • Выбирать inference-движок с учетом архитектуры модели, оборудования и требований продукта;
  • Создавать воспроизводимые контейнерные образы и конфигурации model serving;
  • Настраивать tensor parallelism, pipeline parallelism, batching, KV cache, длину контекста и управление памятью;
  • Подбирать методы квантизации и оптимизации с контролем влияния на качество модели;
  • Определять оптимальное количество и тип GPU для целевых latency, throughput и нагрузки;
  • Проводить профилирование, функциональные и нагрузочные тесты моделей;
  • Находить узкие места на уровне модели, inference-движка, CUDA, GPU, сети и хранилища;
  • Автоматизировать развертывание, обновление, откат и масштабирование моделей в Kubernetes;
  • Настраивать метрики, логи и трассировку model-serving-сервисов;
  • Формировать эталонные конфигурации и таблицы производительности поддерживаемых моделей;
  • Контролировать потребление GPU, утилизацию памяти и стоимость inference;
  • Участвовать в настройке маршрутизации, балансировки и отказоустойчивости сервисов моделей;
  • Адаптировать конфигурации моделей для облачной и on-premise-инфраструктуры;
  • Оценивать новые модели, inference-фреймворки, методы оптимизации и аппаратные платформы;
  • Консультировать продуктовые команды по возможностям, ограничениям и инфраструктурным требованиям моделей;
  • Взаимодействовать с командами разработки моделей, DevOps/SRE, Agents Space и частных инсталляций.

требования

  • Практический опыт запуска LLM или других крупных генеративных моделей в production либо на высоконагруженных стендах;
  • Хорошее понимание архитектуры Transformer и жизненного цикла inference-запроса;
  • Опыт работы хотя бы с одним современным inference-движком: vLLM, NVIDIA TensorRT-LLM, Triton Inference Server, Hugging Face TGI или аналогичным;
  • Понимание tensor/pipeline parallelism, continuous batching, KV cache и методов управления памятью;
  • Знание методов квантизации и их влияния на качество и производительность;
  • Практический опыт работы с GPU, CUDA и инструментами диагностики;
  • Уверенное владение Python;
  • Опыт контейнеризации с Docker и развертывания сервисов в Kubernetes;
  • Опыт проведения нагрузочных тестов и анализа latency, throughput, time to first token и inter-token latency;
  • Опыт настройки мониторинга и профилирования inference-сервисов;
  • Знание Linux, Git и основных принципов CI/CD;
  • Умение документировать эксперименты и принимать решения на основании измеримых результатов;
  • Будет плюсом опыт работы с NVIDIA GPU Operator, DCGM, MIG, NCCL и multi-node inference, знание PyTorch и Hugging Face Transformers, опыт оптимизации моделей с помощью TensorRT, ONNX или custom kernels, опыт работы с Ray Serve, KServe, Seldon или аналогичными системами, понимание особенностей MoE-моделей, speculative decoding и prefix caching, опыт построения автоматизированного контура оценки качества LLM, опыт эксплуатации моделей в on-premise или изолированных средах, опыт расчета и оптимизации unit-экономики inference.

условия

  • Оформление в соответствии с трудовым законодательством РФ;
  • Конкурентный уровень дохода (оклад + годовой бонус);
  • ДМС со стоматологией и возможностью подключения к программе своих детей и родственников;
  • Прозрачная система мотивации, которая позволяет влиять на уровень дохода;
  • Участие в создании инновационных продуктов;
  • Гибкое начало рабочего дня, пятница — сокращенный рабочий день;
  • Возможность работать удаленно;
  • Офис в центре Москвы;
  • Корпоративная мобильная связь;
  • Льготная программа ипотечного и потребительского кредитования;
  • Возможность вертикального и горизонтального роста;
  • Бонусные программы от компаний-партнеров;
  • Возможность получения бонуса за закрытие вакансии по вашей рекомендации;
  • Материальная помощь при рождении детей и других семейных обстоятельствах;
  • Обучение в корпоративном университете за счет компании;
  • Участие в профильных конференциях в качестве спикера или слушателя;
  • Спортивные сообщества и клубы по интересам.

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.