Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой, после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда отвечает за независимую оценку и контроль качества генеративных моделей Сбера, включая GigaChat, Kandinsky, GigaCode и решения PhysicalAI. Она разрабатывает методологии оценки, бенчмарки, метрики и фреймворки, адаптирует мировые бенчмарки под банковские кейсы и проводит R&D-исследования.
задачи
Создавать планы проверки новых моделей: определять метрики, выборки, способы сравнения и критерии реального улучшения качества;
Обеспечивать достоверность измерений;
Выявлять утечки данных в обучение;
Отличать дефекты модели от дефектов замера, промпта или обвязки;
Находить причины ошибок моделей;
Формулировать рекомендации командам разработки;
Разрабатывать LLM- и VLM-судей под конкретные задачи;
Создавать и дорабатывать библиотеки валидации полного цикла;
Следить за развитием исследований в области оценки моделей;
Развивать общие фреймворки оценки для команд Банка;
Создавать бенчмарки для разработчиков Банка и внешнего использования.
требования
Уметь проводить технический и научный ресерч;
Находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации;
Переводить результаты исследований в идеи для тестирования и развития внутренних подходов;
Знать статистику и дизайн эксперимента: доверительные интервалы, размер выборки, проверку гипотез и поправки на множественные сравнения;
Понимать современные AI-агенты и агентные системы;
Знать компоненты агентных систем: роли, инструменты, контекст, память и оркестрацию;
Понимать устройство генеративных моделей: трансформер, механизм внимания, диффузии, токенизацию, параметры генерации и этапы обучения;
Иметь опыт работы с генеративными моделями и понимать методы их оценки;
Знать метрики, бенчмарки, human evaluation и Model-as-a-judge, включая ограничения последнего;
Обладать продуктовым мышлением;
Уметь связывать тестирование с реальными пользовательскими сценариями;
Понимать, какие ошибки критичны для продукта, а также влияние результатов на релиз и развитие модели;
Владеть Python на продакшн-уровне;
Писать чистый код по PEP 8, использовать ООП, типовые паттерны проектирования и аннотации типов;
Работать с линтерами и статическим анализом, включая ruff и mypy;
Создавать, поддерживать, читать и ревьюить production-код eval-пайплайнов;
Будет плюсом R&D-опыт, участие в создании бенчмарков, работа с мультимодальными моделями, evaluation-фреймворками и harness, RAG, асессорами, coding-агентами Claude Code, Codex и Cursor, оркестрацией LangGraph и OpenClaw, навыки вайбкодинга и AI-assisted coding.
условия
Комфортный современный офис рядом с м. Кутузовская;
Ежегодный пересмотр зарплаты и годовая премия;
Корпоративный спортзал и зоны отдыха;
Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития;
Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа;
Гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ;
Подписка Прайм с возможностью совместного использования на трёх близких;
Скидки на продукты компаний-партнеров;
Вознаграждение за рекомендацию друзей в команду Сбера.