Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой, после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Сбер развивает GigaChat — быстрорастущий AI-проект, моделями которого пользуются миллионы людей. Команда делает LLM безопасными, а также развивает GigaEmbeddings — эмбеддер, удерживающий первое место по качеству среди русскоязычных моделей на лидерборде ruMTEB.
задачи
Обучать компактные и быстрые классификаторы входящих и исходящих сообщений с помощью дистилляции и в заданном бюджете задержки, сохраняя качество основной модели;
Развивать контур online-RL, дообучать защиты и модель на свежих атаках и сигналах с продакшена;
Сокращать цикл от обнаружения новой атаки до устойчивости к ней;
Балансировать метрики защиты: пропущенные нарушения и ложные срабатывания;
Выстраивать систематический red teaming: вручную и автоматически искать джейлбрейки, prompt injection и обходы защит;
Проводить red teaming перед каждым релизом и постоянно на живых моделях и продакшен-логах;
Развивать GigaEmbeddings: подбирать и синтезировать данные, применять contrastive learning и hard negatives, выполнять дистилляцию в компактные версии;
Применять эмбеддеры в задачах безопасности: кластеризовать атаки, искать аномалии в пользовательских логах и отслеживать эволюцию техник обхода;
Собирать из продакшен-данных датасеты и целевые тестовые наборы под конкретные кейсы;
Быстро находить по данным причины взлома защиты и характер неисправности;
Превращать разборы инцидентов в улучшения моделей.
требования
Отлично владеть Python и PyTorch;
Иметь практический опыт обучения классификаторов и LLM, а не только их использования;
Иметь опыт с RL-методами дообучения: RLHF, DPO или online-RL;
Уметь работать с продакшен-данными и обучать классификаторы: извлекать сигнал из логов, собирать датасеты, считать метрики и отличать значимые различия от шума;
Иметь опыт обучения guard-моделей, включая Llama Guard и аналоги, или построения высоконагруженных систем модерации;
Иметь опыт обучения эмбеддеров или ретриверов и знать бенчмарки MTEB и ruMTEB;
Иметь опыт автоматизированного red teaming и знать профильную литературу по adversarial robustness;
Иметь опыт работы в командах безопасности разработчиков моделей;
Иметь публикации или вклад в open-source в области AI safety;
Будет плюсом готовность быстро погрузиться в RL-методы дообучения на практическом уровне.
условия
Возможность развивать GigaEmbeddings, больше года удерживающий первое место на ruMTEB;
Команда сильных инженеров и исследователей;
Возможность совмещать управление направлением с глубокой технической работой;