NVIDIA a publié Nemotron 3 Diarization, un modèle à poids ouverts de 100 millions de paramètres pour la diarisation des locuteurs en temps réel, prenant en charge jusqu'à huit locuteurs. Le modèle se classe #1 sur le classement VoiceArena's Diarization-Bench avec un taux d'erreur de diarisation (DER) de 14,72 %, surpassant le système suivant d'une réduction relative d'environ 24 %.
- Prend en charge jusqu'à huit canaux de locuteurs et gère les discours superposés en utilisant l'ordre d'arrivée pour des étiquettes de locuteurs stables.
- A obtenu un DER de 14,72 % sur le benchmark VoiceArena, comparé à 19,3 % pour le système à la deuxième place.
- Entraîné avec des données publiques et des conversations multispeakers sous licence de David AI, ce qui a réduit le DER composé de 0,77 point absolu.
- Offre une latence de streaming configurable avec des latences de tampon d'entrée recommandées de 30,4, 1,04, 0,64 et 0,32 secondes.
- Démonstre une réduction moyenne relative du DER de 41,0 % sur huit benchmarks publics par rapport à la baseline NVIDIA Streaming Sortformer quatre locuteurs précédente.
Le modèle permet aux applications de créer des transcriptions attribuées aux locuteurs en combinant les horodatages de diarisation avec la reconnaissance automatique de la parole, améliorant ainsi l'utilité de l'analyse des conversations et de la mémoire des agents vocaux.