NVIDIA ha lanzado Nemotron 3 Diarization, un modelo de diarización de hablantes con pesos abiertos disponible en Hugging Face bajo la Licencia OpenMDW 1.1. El modelo de 100M parámetros rastrea hasta 8 hablantes superpuestos en tiempo real o en modo offline utilizando un único punto de control.

  • Duplica el límite de hablantes del anterior Streaming Sortformer de NVIDIA, que soportaba 4 hablantes.
  • Obtuvo el primer lugar en el Diarization-Bench inicial de Voice Arena con un DER del 14.72%, una reducción relativa del 24% frente al siguiente sistema clasificado.
  • Ofrece cuatro puntos de operación de latencia que van desde 30.4 segundos para procesamiento offline hasta 0.32 segundos para streaming de ultra baja latencia.
  • Entrenado con aproximadamente 10,000 horas de conversaciones reales y 82,611 horas de mezclas simuladas de múltiples hablantes.
  • Se ejecuta en GPUs de NVIDIA a través de NeMo y soporta formatos que incluyen .wav, .flac, .opus y .mp3.

El modelo permite a herramientas de reuniones, análisis de llamadas y sistemas de memoria de agentes de voz atribuir el habla a hablantes específicos en entornos de audio complejos.