NVIDIA ha puesto a disposición el modelo de chat de voz NemotronLabs-VoiceChat-11B en Hugging Face. El repositorio se describe como compatible con capacidades de comunicación dúplex completo.
NVIDIA lanza el modelo NemotronLabs-VoiceChat-11B en Hugging Face
NVIDIA lanza el modelo de diarización Nemotron 3 de pesos abiertos
NVIDIA ha lanzado Nemotron 3 Diarization, un modelo de pesos abiertos con 100M de parámetros para diarización de hablantes en tiempo real que admite hasta ocho hablantes. El modelo ocupa el puesto #1 en la lista de clasificación Diarization-Bench de VoiceArena con una Tasa de Error de Diarización (DER) del 14.72%, superando al siguiente sistema clasificado con una reducción relativa aproximada del 24%.
NVIDIA Magpie TTS añade árabe, coreano y portugués, y mejora la calidad
NVIDIA ha lanzado una actualización para su modelo de síntesis de voz multilingüe Magpie, ampliando el soporte a doce idiomas con la adición de árabe estándar moderno, coreano y portugués brasileño. La publicación también incluye mejoras de calidad en los idiomas existentes mediante datos de entrenamiento actualizados y cambios arquitectónicos.
NVIDIA lanza NemotronLabs VoiceChat 11B, un modelo de voz a voz full-dúplex abierto con cambio de turno de ~450 ms
NVIDIA ha lanzado NemotronLabs VoiceChat 11B, un modelo de extremo a extremo de voz a voz de 11B parámetros diseñado para conversaciones en tiempo real y full-dúplex. A diferencia de las pilas en cascada que encadenan ASR, LLM y TTS, esta red unificada realiza la comprensión y generación de voz en streaming simultáneamente, logrando una latencia medida de cambio de turno suave de 448 ms en Full-Duplex-Bench 1.0.
Nvidia lanza el LLM unificado de audio y texto Nemotron-Labs-Audex-30B-A3B
Nvidia ha lanzado Nemotron-Labs-Audex-30B-A3B, un gran modelo de lenguaje unificado de audio y texto construido sobre la base MoE solo de texto Nemotron-Cascade-2-30B-A3B. El modelo extiende la arquitectura original con un codificador de audio para las entradas y tokens de audio discretos para las salidas, habilitando capacidades en reconocimiento de voz, traducción, texto a voz y generación de audio.
NemotronLabs lanza VoiceChat, un modelo de voz a voz en dúplex completo de código abierto con llamada de herramientas
NemotronLabs ha presentado VoiceChat, un modelo de código abierto de peso completo para conversión de voz a voz en dúplex completo, diseñado para integrar la escucha, la transcripción, el razonamiento y la habla dentro de una arquitectura de transmisión unificada. El sistema combina un codificador de voz en streaming y un modelo de lenguaje solo-decodificador con flujos de salida especializados en paralelo para texto de agente y llamadas de función estructuradas, junto con una rama RNN-T auxiliar para transcripción incremental del usuario.