NOVA-VAD, un detector de actividad de voz ligero y explicable, alcanza una precisión del 93% en audio ruidoso del conjunto de datos UrbanSound8K, superando a WebRTC (58%), Pyannote (62%) y Silero (87%). Utiliza únicamente scikit-learn, no requiere GPU y proporciona importancia de características y puntuaciones de confianza en inglés sencillo.
NOVA-VAD supera a Silero, Pyannote y WebRTC en audio ruidoso con 93% de precisión
NVIDIA lanza NemotronLabs VoiceChat 11B, un modelo de voz a voz full-dúplex abierto con cambio de turno de ~450 ms
NVIDIA ha lanzado NemotronLabs VoiceChat 11B, un modelo de extremo a extremo de voz a voz de 11B parámetros diseñado para conversaciones en tiempo real y full-dúplex. A diferencia de las pilas en cascada que encadenan ASR, LLM y TTS, esta red unificada realiza la comprensión y generación de voz en streaming simultáneamente, logrando una latencia medida de cambio de turno suave de 448 ms en Full-Duplex-Bench 1.0.
NVIDIA lanza el modelo NemotronLabs-VoiceChat-11B en Hugging Face
NVIDIA ha puesto a disposición el modelo de chat de voz NemotronLabs-VoiceChat-11B en Hugging Face. El repositorio se describe como compatible con capacidades de comunicación dúplex completo.
Freya-TTS lanza un modelo de TTS turco sin tokenizador con WER del 8,0%
Los investigadores presentan Freya-TTS, un modelo compacto de texto a voz sin tokenizador optimizado para turco que alcanza una tasa de error de palabras (WER) del 8,0% en la benchmark Freya-TR-Eval. El Diffusion Transformer condicional no autoregresivo con 183,2 millones de parámetros, basado en matched flow, opera en el espacio latente continuo congelado de AudioVAE2, permitiendo una reconstrucción de alta calidad a 48 kHz sin fonemizador ni tokenizador de habla discreto.
OpenMOSS lanza MOSS-Transcribe-Diarize 0.9B para transcripción y diarización conjuntas
OpenMOSS ha lanzado MOSS-Transcribe-Diarize, un modelo de comprensión de audio de extremo a extremo con 0.9B de parámetros diseñado para la transcripción larga de múltiples hablantes, diarización, marcas de tiempo y conciencia de eventos acústicos.
Gepard 1.0 abre el código de un modelo TTS en streaming para diálogo en tiempo real
Los investigadores han abierto el código de Gepard 1.0, un modelo de texto a voz (TTS) diseñado principalmente para streaming, pensado para conversaciones en tiempo real que genera audio cuadro por cuadro a medida que llega el texto. El modelo se basa en una arquitectura Qwen3.5 0.8B con Nemo NanoCodec y admite clonación de voz zero-shot en inglés, español, portugués y neerlandés.