NemotronLabs ha presentado VoiceChat, un modelo de código abierto de peso completo para conversión de voz a voz en dúplex completo, diseñado para integrar la escucha, la transcripción, el razonamiento y la habla dentro de una arquitectura de transmisión unificada. El sistema combina un codificador de voz en streaming y un modelo de lenguaje solo-decodificador con flujos de salida especializados en paralelo para texto de agente y llamadas de función estructuradas, junto con una rama RNN-T auxiliar para transcripción incremental del usuario.
- En Full-Duplex-Bench 1.0, el modelo logra las tasas más bajas de toma de control por manejo de pausas entre los sistemas evaluados de peso completo abierto, con un 100% de toma de control tras interrupciones del usuario y una puntuación de calidad de respuesta post-interrupción de 4.33/5.
- Reanuda las respuestas después de los retroalimentaciones del usuario en el 93% de los casos en Full-Duplex-Bench 1.5.
- El modelo obtiene un promedio normalizado de 55.1 en VoiceBench y logra un F1 de selección de herramientas del 82.5% en Full-Duplex-Bench 3.0, aunque la precisión de los argumentos y la ejecución de herramientas de extremo a extremo requieren mejoras.
Estos resultados demuestran que la interacción en dúplex completo, el reconocimiento y la generación de voz, las capacidades generales de lenguaje y el uso de herramientas externas pueden integrarse en un único modelo abierto sin sacrificar el comportamiento conversacional en tiempo real.