NVIDIA a publié Nemotron 3 Diarization, un modèle de diarisation de locuteurs à poids ouverts disponible sur Hugging Face sous la licence OpenMDW 1.1. Le modèle de 100M de paramètres suit jusqu'à 8 locuteurs en chevauchement en temps réel ou hors ligne à l'aide d'un seul point de contrôle.
- Double la limite de locuteurs par rapport au Streaming Sortformer précédent de NVIDIA, qui prenait en charge 4 locuteurs.
- A obtenu la première place sur le Diarization-Bench initial de Voice Arena avec un DER de 14,72 %, soit une réduction relative de 24 % par rapport au système classé juste après.
- Offre quatre points de fonctionnement de latence allant de 30,4 secondes pour le traitement hors ligne à 0,32 seconde pour le streaming à ultra-faible latence.
- Entraîné sur environ 10 000 heures de conversations réelles et 82 611 heures de mélanges simulés multi-locuteurs.
- Fonctionne sur les GPU NVIDIA via NeMo et prend en charge des formats incluant .wav, .flac, .opus et .mp3.
Le modèle permet aux outils de réunion, à l'analyse d'appels et aux systèmes de mémoire d'agents vocaux d'attribuer la parole à des locuteurs spécifiques dans des environnements audio complexes.