أطلقت إنفidia نموذج Nemotron 3 Diarization، وهو نموذج مفتوح الأوزان لتصنيف المتحدثين، متاح على Hugging Face بموجب ترخيص OpenMDW الإصدار 1.1. يتعقب النموذج ذو الـ 100 مليون معلمة ما يصل إلى 8 متحدثين متداخلين في الوقت الفعلي أو في الأوضاع غير المتزامنة باستخدام نقطة تفتيش واحدة.
- يضاعف حد المتحدثين من نموذج NVIDIA السابق Streaming Sortformer، الذي كان يدعم 4 متحدثين.
- حقق المركز الأول في Diarization-Bench الأولي من Voice Arena بنسبة DER تبلغ 14.72٪، أي انخفاض نسبي بنسبة 24٪ مقارنة بالنظام التالي في الترتيب.
- يوفر أربع نقاط تشغيل للزمن الكامن تتراوح بين 30.4 ثانية للمعالجة غير المتزامنة و0.32 ثانية للبث منخفض الزمن الكامن للغاية.
- تم تدريبه على حوالي 10,000 ساعة من المحادثات الحقيقية و82,611 ساعة من مزيج المتحدثين المتعددين المُحاكى.
- يعمل على وحدات معالجة الرسومات من NVIDIA عبر NeMo ويدعم صيغًا تشمل .wav و.flac و.opus و.mp3.
يمكن النموذج أدوات الاجتماعات وتحليل المكالمات وأنظمة ذاكرة الوكلاء الصوتيين من نسب الكلام إلى متحدثين محددين في بيئات صوتية معقدة.