NVIDIA ने Hugging Face पर OpenMDW License 1.1 के तहत उपलब्ध एक ओपन-वेट स्पीकर डायरिजेशन मॉडल Nemotron 3 Diarization जारी किया है। यह 100M-पैरामीटर वाला मॉडल एकल चेकपॉइंट का उपयोग करके रियल-टाइम या ऑफलाइन मोड में 8 ओवरलैपिंग वक्ताओं को ट्रैक करता है।
- NVIDIA के पिछले Streaming Sortformer से वक्ता सीमा को दोगुना किया गया, जो 4 वक्ताओं का समर्थन करता था।
- Voice Arena के प्रारंभिक Diarization-Bench पर 14.72% DER के साथ पहले स्थान पर पहुंचा, जो अगले रैंक वाले सिस्टम की तुलना में 24% सापेक्ष कमी है।
- ऑफलाइन प्रोसेसिंग के लिए 30.4 सेकंड से लेकर अल्ट्रा-लो लेटेंसी स्ट्रीमिंग के लिए 0.32 सेकंड तक चार लेटेंसी ऑपरेटिंग पॉइंट्स प्रदान करता है।
- लगभग 10,000 घंटे की वास्तविक बातचीत और 82,611 घंटे के सिमुलेटेड मल्टी-टॉकर मिक्सचर पर प्रशिक्षित किया गया है।
- NeMo के माध्यम से NVIDIA GPUs पर चलता है और .wav, .flac, .opus, और .mp3 सहित फॉर्मेट्स का समर्थन करता है।
यह मॉडल मीटिंग टूल्स, कॉल एनालिटिक्स, और वॉइस-एजेंट मेमोरी सिस्टम्स को जटिल ऑडियो वातावरण में बोलचाल को विशिष्ट वक्ताओं से जोड़ने की सुविधा देता है।