NVIDIA выпустила NemotronLabs VoiceChat 11B, открытую сквозную модель преобразования речи в речь на 11B параметров, предназначенную для разговоров в реальном времени в полнодуплексном режиме. В отличие от каскадных стеков, объединяющих ASR, LLM и TTS, эта унифицированная сеть одновременно выполняет потоковое понимание и генерацию речи, демонстрируя измеренную плавную задержку переключения 448 мс на Full-Duplex-Bench 1.0.
- Архитектура объединяет кодировщик Fast Conformer, основу LLM Nemotron Nano v2 и декодер TTS от NVIDIA, обученные на примерно 550 тыс. часов аудио.
- Поддерживается вызов инструментов в реальном времени через отдельный выходной канал для скриптов <TOOLCALL>, позволяя операторам определять сообщения «на удержании» для предотвращения тишины во время вызовов API.
- Модель позволяет пользователям перебивать говорящего в середине реплики с показателем перехвата 1.00 при задержке 480 мс и занимает #2 место среди открытых полнодуплексных моделей на VoiceBench.
- Веса доступны под лицензией OpenMDW-1.1, разрешающей свободное использование, но NVIDIA помечает чекпоинт как готовый только для исследовательских целей из-за известных сбоев, таких как ограничения контекстного окна.
- Для развертывания требуется один GPU с объемом VRAM не менее 80 ГБ, например A100 или H100; размещенный API в настоящее время не предоставляется.
Выпуск предоставляет вариант для пилотных проектов в контакт-центрах, автомобильных помощниках и средствах обеспечения доступности, хотя его пока не рекомендуется использовать в продакшене.