أطلقت شركة نفيديا نموذج Nemotron 3 Diarization، وهو نموذج مفتوح الأوزان يحتوي على 100 مليون معامل، مصمم لتمييز المتحدثين في الوقت الفعلي ويدعم ما يصل إلى ثمانية متحدثين. يحتل النموذج المرتبة الأولى على لوحة المتصدرين لـ VoiceArena's Diarization-Bench بمعدل خطأ تمييز (DER) يبلغ 14.72٪، متفوقًا على النظام التالي بنسبة تخفيض نسبية تقارب 24٪.

  • يدعم ما يصل إلى ثمانية قنوات للمتحدثين ويتعامل مع الكلام المتداخل باستخدام ترتيب وقت الوصول للحصول على ملصقات مستقرة للمتحدثين.
  • حقق معدل خطأ تمييز (DER) بنسبة 14.72٪ على المعيار الخاص بـ VoiceArena، مقارنةً بـ 19.3٪ للنظام في المركز الثاني.
  • تم تدريبه باستخدام بيانات عامة ومحادثات متعددة المتحدثين مرخصة من David AI، مما أدى إلى خفض معدل DER المركب بمقدار 0.77 نقطة مطلقة.
  • يوفر زمن انتقال تدفق قابل للتكوين مع توصيات لزمن انتقال مخزن الإدخال تبلغ 30.4 و1.04 و0.64 و0.32 ثانية.
  • يُظهر تخفيضًا نسبيًا في معدل DER بنسبة 41.0٪ متوسط عبر ثمانية معايير عامة مقارنةً بالخط الأساسي السابق من نفيديا وهو Streaming Sortformer لتمييز أربعة متحدثين.

يمكن للنموذج تمكين التطبيقات من إنشاء نسخ مكتوبة تُنسب إلى المتحدثين عن طريق دمج طوابع زمنية للتمييز مع التعرف التلقائي على الكلام، مما يعزز فائدة تحليل المحادثات وذاكرة وكلاء الصوت.