Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой, после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда отвечает за независимую оценку и контроль качества генеративных моделей Сбербанка, включая GigaChat, Kandinsky, GigaCode и решения PhysicalAI. Она разрабатывает методологии оценки, метрики, бенчмарки и фреймворки, а также исследует качество моделей до их выхода к пользователям.
задачи
Создавать план проверки новых моделей: определять измеряемые параметры, выборки, сравнения и критерии реального качества;
Обеспечивать достоверность измерений;
Выявлять утечки данных в обучение;
Отличать дефекты модели от дефектов замера, промпта или обвязки;
Анализировать причины ошибок моделей;
Формулировать рекомендации командам разработки;
Разрабатывать LLM- и VLM-судей под конкретные задачи;
Создавать и дорабатывать библиотеки валидации полного цикла;
Следить за современными исследованиями в области оценки моделей;
Разрабатывать общие фреймворки оценки для команд Банка;
Создавать бенчмарки для оценки качества моделей.
требования
Умение проводить технический и научный ресерч;
Навыки критического анализа актуальных статей, бенчмарков, моделей и реализаций;
Умение переводить результаты ресерча в идеи для тестирования и развития внутренних подходов;
Знание статистики и дизайна экспериментов;
Понимание доверительных интервалов, размера выборки, проверки гипотез и поправок на множественные сравнения;
Понимание современных AI-агентов и агентных систем;
Знание компонентов агентных систем: ролей, инструментов, контекста, памяти и оркестрации;
Понимание устройства генеративных моделей: трансформеров, механизма внимания, диффузии, токенизации, параметров генерации и этапов обучения;
Опыт работы с генеративными моделями и их оценкой;
Знание метрик, бенчмарков, human evaluation и Model-as-a-judge;
Продуктовое мышление;
Умение связывать тестирование с пользовательскими сценариями и оценивать влияние результатов на релиз и развитие модели;
Python на продакшн-уровне;
Умение писать чистый код по PEP 8, применять ООП, типовые паттерны проектирования и аннотации типов;
Привычка использовать линтеры и статический анализ, включая ruff и mypy;
Опыт создания и поддержки production-кода eval-пайплайнов;
Умение читать и проводить ревью чужого кода;
Будет плюсом R&D-опыт, участие в создании бенчмарков, работа с мультимодальными моделями, evaluation-фреймворками и harness, RAG, асессорами, coding-агентами, LangGraph, OpenClaw, вайбкодингом и AI-assisted coding.
условия
Гибкий формат работы, в том числе на территории РФ;
Ежегодный пересмотр зарплаты;
Годовая премия;
Современный офис рядом с м. Кутузовская;
Корпоративный спортзал и зоны отдыха;
Более 400 образовательных программ СберУниверситета;
Расширенный ДМС;
Льготное страхование для семьи;
Корпоративная пенсионная программа;
Дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ;
Подписка Прайм с возможностью совместного использования на троих;