NemotronLabs представила VoiceChat, открытую полнодуплексную модель преобразования речи в речь с открытыми весами, предназначенную для интеграции прослушивания, транскрипции, рассуждений и генерации речи в рамках единой потоковой архитектуры. Система объединяет потоковый речевой энкодер и декодирующую языковую модель с параллельными специализированными выходными потоками для текста агента и структурированных вызовов функций, а также вспомогательным ветвлением RNN-T для инкрементальной транскрипции пользователя.
- На Full-Duplex-Bench 1.0 модель демонстрирует наименьшие показатели захвата паузы среди оцененных систем с открытыми весами: 100% захвата после прерываний пользователем и оценка качества ответа после прерывания 4,33 из 5.
- В 93% случаев на Full-Duplex-Bench 1.5 модель возобновляет ответ после бэкканалов пользователя.
- Модель набирает 55,1 нормализованного среднего балла на VoiceBench и достигает F1 для выбора инструмента 82,5% на Full-Duplex-Bench 3.0, хотя точность аргументов и сквозное выполнение инструментов требуют улучшения.
Эти результаты демонстрируют, что полнодуплексное взаимодействие, распознавание и генерация речи, общие языковые способности и использование внешних инструментов могут быть интегрированы в единую открытую модель без ущерба для поведения в реальном времени.