Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузи резюме
описание
Компания разрабатывает персонализированных AI-компаньонов с эмоциональной гибкостью, памятью и самоизменением. Она развивает собственные агентные архитектуры на основе открытых моделей и данных и обслуживает десятки миллионов диалогов.
задачи
Ускорять и масштабировать большие языковые модели в продакшене
Оптимизировать инференс моделей до 1T+ параметров с помощью SGLang, KV- и prefix-кэширования, speculative decoding и квантизации
Разворачивать распределённый инференс с использованием MoE, tensor, expert и pipeline parallelism на многосерверных и много-GPU-кластерах
Обучать и дообучать модели-компаньоны с помощью SFT, DPO и RLHF
Улучшать агентные каркасы и алгоритмы чата
Проводить техническое руководство: проверять эксперименты команды из семи инженеров NLP/CV, выбирать направления и оценивать гипотезы
требования
Глубокий опыт оптимизации LLM в продакшене с SGLang, vLLM или TensorRT-LLM
Опыт распределённого инференса или обучения крупных моделей с MoE и многосерверными кластерами
Понимание профилирования GPU, работы ядер attention и KV-кэша
Практический опыт дообучения моделей с RLHF, DPO или аналогами
Сильный опыт работы с PyTorch и Transformers
Профессиональное владение английским или русским языком
Будет плюсом: опыт разработки ядер CUDA/Triton, опыт в CV с ускорением инференса крупных генеративных моделей, работа в AI-стартапах или BigTech, профильное математическое или компьютерно-научное образование
условия
Полностью удалённая работа
28 Дней отпуска и 7 wellness-дней в год без больничных листов
$1,000 На обустройство домашнего офиса раз в 3 года
Софинансирование обучения и конференций в размере 50%
Компенсация медицинских расходов до $1,000 в год
Доступ к опциональной программе с опционами или долей от выручки после года работы