Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой, после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда отвечает за оценку модельного риска и независимый контроль генеративных моделей Банка. В зоне ответственности находятся текстовые и мультимодальные LLM GigaChat, а также open-source модели.
задачи
Развивать собственный фреймворк оценки LLM;
Писать чистый код фреймворка и проверять чужой;
Проводить код-ревью и поддерживать растущую кодовую базу;
Настраивать автоматизацию и CI;
Проводить регулярную валидацию версий GigaChat и open-source альтернатив по единой методике;
Разрабатывать и актуализировать собственные бенчмарки под ключевые сценарии Банка;
Подбирать задачи, редкие и намеренно трудные случаи, эталонные ответы;
Превращать вопрос об улучшении модели в план проверки;
Создавать судей под конкретные задачи и калибровать их оценки против человеческих;
Определять случаи, когда автоматическая оценка не подходит;
Снижать стоимость измерений без потери достоверности;
Оценивать автономность модели в сценарии и цену её ошибки;
Формулировать условия выпуска, ограничения по сценариям, митигации и мониторинг;
Указывать непроверенные аспекты и защищать выводы перед командой разработки и руководством;
Следить за новыми подходами в научном сообществе и читать статьи;
Писать собственные статьи;
Внедрять лучшие практики оценки в процессы Банка;
Создавать необходимые инструменты самостоятельно.
требования
Писать production-код на Python по PEP 8;
Владеть ООП и типовыми паттернами проектирования;
Использовать аннотации типов, линтеры и статический анализ;
Создавать и поддерживать production-код evaluation-пайплайнов;
Читать и проверять чужой код;
Знать статистику и дизайн эксперимента;
Уметь работать с доверительными интервалами, размером выборки, проверкой гипотез и поправками на множественные сравнения;
Понимать разницу между статистической и практической значимостью;
Понимать устройство LLM, трансформеров и механизма внимания;
Понимать токенизацию и влияние параметров генерации на ответы;
Различать этапы обучения моделей: предобучение, дообучение на инструкциях и обучение на человеческих предпочтениях;
Иметь опыт работы с LLM;
Понимать оценку генеративных моделей, включая метрики, human evaluation и LLM-as-a-judge;
Понимать ограничения LLM-as-a-judge;
Уметь заранее выяснять цену ошибки;
Быть готовым работать без готовой методологии;
Проявлять проактивность и уметь декомпозировать большие задачи;
Будет плюсом опыт с open-source моделями и инференсом, мультимодальными моделями, evaluation-фреймворками и evaluation harness, CI/CD, асессорами, coding-агентами, оптимизацией инференса и RAG.
условия
Офис рядом с м. Кутузовская;
Можно выбрать офисный или гибридный график;
Ежегодный пересмотр зарплаты;
Годовая премия по итогам работы 2–4 оклада;
Программа адаптации и помощь руководителя на старте;
Более 400 образовательных программ СберУниверситета;
Корпоративный спортзал и зоны отдыха;
Расширенный ДМС;
Льготное страхование для семьи;
Корпоративная пенсионная программа;
Дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ;
Подписка Прайм с возможностью совместного использования на трех близких;
Скидки на продукты компаний-партнеров;
Вознаграждение за рекомендацию друзей в команду Сбера.