NVIDIA ha lanzado NemotronLabs VoiceChat 11B, un modelo de extremo a extremo de voz a voz de 11B parámetros diseñado para conversaciones en tiempo real y full-dúplex. A diferencia de las pilas en cascada que encadenan ASR, LLM y TTS, esta red unificada realiza la comprensión y generación de voz en streaming simultáneamente, logrando una latencia medida de cambio de turno suave de 448 ms en Full-Duplex-Bench 1.0.
- La arquitectura combina un codificador Fast Conformer, el núcleo LLM Nemotron Nano v2 y un decodificador TTS de NVIDIA, entrenado con aproximadamente 550k horas de audio.
- Admite la llamada de herramientas en vivo a través de un canal de salida separado para scripts <TOOLCALL>, permitiendo a los operadores definir mensajes de "espera" para evitar silencio muerto durante las llamadas API.
- El modelo permite a los usuarios interrumpir el turno con una tasa de toma de 1.00 a 480 ms, y se clasifica en el #2 entre modelos full-dúplex abiertos en VoiceBench.
- Los pesos están disponibles bajo la licencia permisiva OpenMDW-1.1, pero NVIDIA etiqueta el checkpoint como listo solo para fines de investigación debido a modos de fallo conocidos como límites de techo de contexto.
- El despliegue requiere una sola GPU con al menos 80 GB de VRAM, como una A100 o H100, y actualmente no se proporciona ninguna API alojada.
El lanzamiento proporciona una opción desplegable para pilotos en centros de contacto, asistentes automotrices y herramientas de accesibilidad, aunque aún no se recomienda para uso en producción.