Если вы раньше входили через Google, сбросьте пароль для своей Gmail-почты через кнопку «Забыли пароль?» на экране входа. Затем войдите по email и новому паролю.
Если аккаунта ещё нет, зарегистрируйтесь с Gmail-почтой, после подтверждения почты мы предложим задать пароль.
Что нового
Загружаю обновления...
Что нового
Загружаю обновления...
Работа найдется быстрее с подпискойКандидат найдётся быстрее с подпиской
Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда занимается исследованиями и разработкой омнимодальной архитектуры Full-Duplex, которая обеспечивает одновременную обработку аудио, текста и визуальной информации в реальном времени, включая понимание перебиваний и естественного диалога.
задачи
Разрабатывать full-duplex мультимодальные архитектуры для одновременного восприятия и генерации речи;
Обрабатывать перебивания, паузы и естественный диалог в реальном времени;
Интегрировать речь, текст и визуальные модальности в единую архитектуру;
Выполнять мультимодальный reasoning и синхронизацию потоков данных;
Обучать и оптимизировать модели для достижения низкой латентности и стриминга;
Исследовать и внедрять современные подходы, включая end-to-end модели, стриминговые трансформеры и мультимодальные большие языковые модели.
требования
Отличное владение Python 3;
Опыт работы с PyTorch, bash, git, Docker, dvc, HF Transformers;
Глубокое понимание ASR, TTS, DSP ML, обработки речи и аудио;
Опыт работы со стриминговыми и real-time системами;
Понимание MLOps-практик, включая мониторинг моделей, отслеживание дрейфа данных и CI/CD;
Умение быстро анализировать и воспроизводить идеи из научных публикаций;
Будет плюсом опыт работы в доменах речи, музыки или с голосовыми ассистентами, знание мультимодальных LLM / VLM / Audio-LM, наличие публикаций или исследовательского бэкграунда.