Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузи резюме
описание
Направление ускоряет инференс нейронных сетей для автономного вождения: моделей восприятия сцены и планирования, работающих на бортовом оборудовании автомобиля. ML-команды отвечают за обучение и качество моделей, а направление обеспечивает их эффективное выполнение на целевых платформах с минимальной потерей точности. В работе используются PyTorch, ONNX, TensorRT и внутренняя инфраструктура профилирования, экспериментов и анализа производительности.
задачи
Руководить командой оптимизации инференса на CUDA
Формировать технические планы и приоритеты, контролировать выполнение проектов и отвечать за результаты по задержке, пропускной способности и эффективности использования памяти на целевом оборудовании
Проектировать и оптимизировать вычислительные ядра CUDA и операции объединения для ключевых блоков моделей, включая матричное умножение, свёртки и механизмы внимания
Снижать трафик памяти и накладные расходы на запуск, добиваясь устойчивого ускорения в сквозных сценариях
Эффективно использовать иерархию памяти GPU, размещение данных, разбиение на блоки, тензорные ядра и механизмы повышения загрузки вычислительных блоков
Анализировать узкие места с помощью Nsight и других профилировщиков
Формировать варианты оптимизации с учётом ограничений оборудования
Определять технический вектор команды и участвовать в ключевых решениях по производительности
требования
Сильный опыт оптимизации производительности на CUDA
Опыт работы с вычислительными ядрами для матричного умножения, свёрток и механизмов внимания
Хорошее знание C++
Понимание иерархии памяти GPU и модели вычислительных затрат
Умение находить узкие места с помощью профилирования и добиваться измеримого ускорения
Способность к техническому лидерству или управлению командой
Умение аргументировать решения по производительности и работать в межкомандной среде
Будет плюсом: опыт работы с CUTLASS, Triton и пользовательскими движками инференса, оптимизация моделей под конкретные архитектуры GPU, работа с квантованием и смешанной точностью, построение roofline-моделей и оценок задержки и пропускной способности, знание методов объединения операций и оптимизации графов вычислений
Отслеживание городского транспорта в режиме реального времени, маршруты с пересадками, информация о пробках и остановках. Всё это теперь встроено в Яндекс Go, а также доступно в разделе «Транспорт» в Яндекс Картам