A NVIDIA lançou o Nemotron 3 Diarization, um modelo de diarização de falantes com pesos abertos disponível no Hugging Face sob a Licença OpenMDW 1.1. O modelo de 100M parâmetros rastreia até 8 falantes sobrepostos em tempo real ou em modo offline usando um único checkpoint.

  • Dobra o limite de falantes em relação ao Streaming Sortformer anterior da NVIDIA, que suportava 4 falantes.
  • Alcançou o primeiro lugar no Diarization-Bench inicial da Voice Arena com 14,72% de DER, uma redução relativa de 24% em relação ao sistema classificado em seguida.
  • Oferece quatro pontos de operação de latência variando de 30,4 segundos para processamento offline a 0,32 segundos para streaming de ultra-baixa latência.
  • Treinado com aproximadamente 10.000 horas de conversas reais e 82.611 horas de misturas simuladas de múltiplos falantes.
  • Executa em GPUs da NVIDIA via NeMo e suporta formatos incluindo .wav, .flac, .opus e .mp3.

O modelo permite que ferramentas de reuniões, análises de chamadas e sistemas de memória de agentes de voz atribuam o discurso a falantes específicos em ambientes de áudio complexos.