NVIDIA telah merilis Nemotron 3 Diarization, model diarisasi pembicara dengan bobot terbuka yang tersedia di Hugging Face di bawah Lisensi OpenMDW 1.1. Model 100M-parameter ini melacak hingga 8 pembicara yang tumpang tindih dalam mode waktu nyata atau offline menggunakan satu checkpoint.

  • Menggandakan batas pembicara dari Streaming Sortformer sebelumnya NVIDIA, yang mendukung 4 pembicara.
  • Meraih peringkat pertama di Diarization-Bench awal Voice Arena dengan DER 14.72%, penurunan relatif sebesar 24% dibandingkan sistem berikutnya.
  • Menawarkan empat titik operasi latensi mulai dari 30.4 detik untuk pemrosesan offline hingga 0.32 detik untuk streaming latensi ultra-rendah.
  • Dilatih pada sekitar 10.000 jam percakapan nyata dan 82.611 jam campuran multi-pembicara simulasi.
  • Berjalan di GPU NVIDIA melalui NeMo dan mendukung format termasuk .wav, .flac, .opus, dan .mp3.

Model ini memungkinkan alat rapat, analitik panggilan, dan sistem memori agen suara untuk mengaitkan ucapan kepada pembicara tertentu dalam lingkungan audio yang kompleks.