تم إصدار لوحة المتصدرين المفتوحة لأنظمة تحويل النص إلى كلام (TTS) لمعالجة التشتت ونقص المعايير في تقييم هذه الأنظمة، وذلك باستخدام مقاييس موضوعية بدلاً من الاعتماد حصرياً على درجات تفضيل البشر البطيئة والمعتمدة على قاعات التصويت. وتقوم بتقييم النماذج من حيث الوضوح والسرعة وتشابه المتحدثين باستخدام نماذج Qwen3 ASR وتضمينات WavLM.

  • يُقاس الوضوح عبر معدل خطأ الكلمات/الأحرف (WER/CER) بين النص الأصلي والنص المستخرج من الصوت المُولّد.
  • تُقاس السرعة بعامل الوقت الحقيقي العكسي (RTFx) للاستدلال غير المتدفق على دفعات، وزمن وصول أول صوت (TTFA) لتأخير البث المباشر على معالجات H200 GPUs ووحدة المعالجة المركزية.
  • يُحسب تشابه المتحدث باستخدام التشابه جيب التمام بين تضمينات WavLM للصوت المُولّد والمقطع المرجعي.
  • تدعم المنصة التقييم متعدد اللغات، مع التبديل بين معدل خطأ الكلمات الإنجليزي والدرجات القائمة على الأحرف للصينية واليابانية والكورية.
  • تتيح علامة تبويب "الاستماع" للمستخدمين مقارنة المخرجات والتصويت على التفضيلات، بينما تصنف علامة تبويب "البث المباشر" النماذج حسب TTFA للتطبيقات التفاعلية.

تهدف لوحة المتصدرين إلى مواكبة الإصدارات السريعة لأنظمة تحويل النص إلى كلام وتسليط الضوء على النماذج مفتوحة المصدر التي غالباً ما تكون ممثلة تمثيلاً ناقصاً في القاعات التجارية، وتدعو المجتمع لتقديم ملاحظاته لتشكيل المقاييس ومجموعات البيانات المستقبلية.