Улучшать следование инструкциям и строить систему тестирования и оценки
Обучать LoRA / QLoRA-адаптеры для разных доменов и задач
Работать с моделями вознаграждения, проверяющими моделями и функциями вознаграждения для RL
Разрабатывать RAG-системы: поиск, ранжирование, подготовку контекста и оценку
Обучать и интегрировать использование инструментов, вызовы функций и структурированные выходные данные
Оптимизировать запуск моделей и обслуживание запросов с помощью vLLM / SGLang
требования
Практический опыт тонкой настройки и постобучения LLM
Опыт работы с SFT и оптимизацией предпочтений: DPO / IPO / ORPO / SimPO или аналогами
Опыт или хорошее практическое понимание Online RL для LLM: GRPO / GSPO или аналогичных методов
Понимание моделей вознаграждения, данных о предпочтениях и оценки LLM
Уверенное владение Python, PyTorch и Hugging Face Transformers
Опыт работы с TRL и/или verl
Опыт работы с LoRA / QLoRA / PEFT
Опыт запуска моделей и обслуживания запросов через vLLM и/или SGLang
Опыт разработки RAG, использования инструментов или структурированной генерации
Понимание архитектуры современных LLM и особенностей их обучения и запуска
Опыт работы с GPU, распределённым обучением, Linux, Docker и Git
Умение самостоятельно ставить эксперименты, выбирать метрики и анализировать результаты
Будет плюсом: предварительное обучение моделей на новых данных или доменах, RL для рассуждений, многоязычные LLM или генерация кода, FSDP / DeepSpeed / Megatron-LM, квантизация и оптимизация запуска моделей