NemotronLabs ha presentado NemotronLabs VoiceChat, un modelo de voz a voz full-dúplex de pesos abiertos que integra capacidades nativas de llamada a herramientas dentro de una arquitectura de transmisión unificada. El sistema combina un codificador de audio en streaming y un modelo de lenguaje solo-decodificador con flujos de salida paralelos para texto del agente y llamadas a funciones estructuradas, junto con una rama RNN-T auxiliar para transcripción incremental y un decodificador TTS en streaming.
- Logra las tasas más bajas de toma de control por manejo de pausas entre los sistemas de pesos abiertos evaluados en Full-Duplex-Bench 1.0, con un 100% de toma de control tras interrupciones del usuario y una puntuación de calidad de respuesta post-interrupción de 4.33/5.
- Reanuda las respuestas después de los retroalimentaciones del usuario en el 93% de los casos en Full-Duplex-Bench 1.5.
- Obtiene un promedio normalizado de 55.1 en VoiceBench y una puntuación F1 de selección de herramientas del 82.5% en Full-Duplex-Bench 3.0, aunque la precisión de los argumentos y la ejecución de herramientas de extremo a extremo requieren mejoras.
El modelo demuestra que la interacción full-dúplex, el reconocimiento y la generación de voz, las capacidades generales de lenguaje y el uso de herramientas externas pueden integrarse en un único modelo de voz a voz abierto sin sacrificar el comportamiento conversacional en tiempo real.