NemotronLabs представила NemotronLabs VoiceChat, открытую полнодуплексную модель преобразования речи в речь с весами, которая интегрирует нативные возможности вызова инструментов в единую потоковую архитектуру. Система объединяет потоковый речевой энкодер и языковую модель только для декодирования с параллельными выходными потоками для текста агента и структурированных вызовов функций, а также вспомогательный ветвь RNN-T для инкрементальной транскрипции и потоковый декодер TTS.

  • Демонстрирует наименьшие показатели перехвата управления при обработке пауз среди оцененных систем с открытыми весами на Full-Duplex-Bench 1.0, с показателем перехвата 100% после прерываний пользователя и оценкой качества ответа после прерывания 4.33/5.
  • Восстанавливает ответы после бэкканалов пользователя в 93% случаев на Full-Duplex-Bench 1.5.
  • Получает нормализованный средний балл 55.1 на VoiceBench и F1-меру выбора инструмента 82.5% на Full-Duplex-Bench 3.0, хотя точность аргументов и сквозное выполнение инструментов требуют улучшения.

Модель демонстрирует, что полнодуплексное взаимодействие, распознавание и генерация речи, общие языковые возможности и использование внешних инструментов могут быть интегрированы в единую открытую модель преобразования речи в речь без ущерба для поведения в реальном времени.