Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой, после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда развивает GigaChat и обучает большие языковые модели на кластерах H100 и B200, при этом pretrain является ядром самого быстрорастущего AI-проекта Сбера.
задачи
Развивать архитектуру моделей GigaChat;
Определять, как должна развиваться архитектура pretrain-моделей: какие направления наиболее важны, как измерять прогресс и что в первую очередь ограничивает рост качества модели;
Проектировать архитектуру флагманских моделей и отвечать за ключевые архитектурные решения: attention, позиционные схемы, нормализации, активации, инициализация;
Развивать MoE-архитектуру: маршрутизация, балансировка экспертов, устойчивость маршрутизатора, влияние на качество и производительность;
Работать с long-context и мультимодальностью на уровне архитектуры: что именно нужно менять в модели, чтобы эти возможности работали стабильно;
Изучать и применять законы масштабирования;
Проводить scaling-эксперименты и на их основе принимать решения по размеру модели, ширине / глубине, числу и размеру экспертов, размерам батча и длительности обучения;
Предсказывать, как архитектурные изменения поведут себя при переходе с небольших абляций на полный масштаб;
Определять и развивать метрики, которые корректно отражают архитектурные изменения в обучении моделей;
Определять, в каких случаях архитектурные изменения действительно дают прирост качества по сравнению с более простыми baseline'ами, а в каких — нет;
Анализировать стабильность архитектурных решений;
Разбираться с нестабильностью на больших прогонах со стороны архитектуры: почему конкретная конфигурация расходится, где проявляются артефакты маршрутизации, коллапс энтропии, неустойчивости в attention;
Предлагать изменения в нормализациях, клиппинге, точности вычислений и структуре блоков, которые делают обучение более предсказуемым;
Обеспечивать безопасное масштабирование при внедрении крупных архитектурных изменений в основной трейн;
Писать ключевой код и оставаться сильным исследователем;
Самостоятельно писать и дорабатывать архитектурные компоненты и абляции;
Делать надёжные и воспроизводимые эксперименты: понятные версии данных, конфиги, сравнение запусков, контроль деградаций;
Читать статьи, воспроизводить ключевые результаты и адаптировать лучшие идеи под наши задачи и инфраструктуру;
Руководить сильной технической командой;
Руководить командой исследователей и инженеров, работающих над архитектурой, задавать высокую планку по качеству решений, скорости работы и глубине проработки;
Помогать команде превращать архитектурные идеи в работающие решения, которые можно встроить в основной цикл обучения;
Удерживать баланс между глубиной исследований, инженерной надёжностью и практическим результатом для модели.
требования
Отличное владение Python и PyTorch;
Глубокое понимание устройства обучения нейросетей: на уровне, где вы можете объяснить, почему конкретная архитектурная конфигурация расходится, глядя на кривые функции потерь, нормы градиентов и энтропии;