टेक्स्ट-टू-स्पीच (TTS) इवैल्यूएशन में विखंडन और मानकीकरण की कमी को दूर करने के लिए ओपन टीटीएस लीडरबोर्ड जारी किया गया है, जो धीमे, एरीना-आधारित मानव प्राथमिकता स्कोर पर निर्भर रहने के बजाय ऑब्जेक्टिव मेट्रिक्स का उपयोग करता है। यह Qwen3 ASR और WavLM एम्बेडिंग्स का उपयोग करके इंटेलिजिबिलिटी, स्पीड और स्पीकर समानता के आधार पर मॉडल का मूल्यांकन करता है।

  • इंटेलिजिबिलिटी को प्रॉम्प्ट और जनरेटेड ऑडियो ट्रांसक्रिप्ट के बीच शब्द/अक्षर त्रुटि दर (WER/CER) के माध्यम से मापा जाता है।
  • स्पीड को बैच्ड ऑफलाइन इनफरेंस के लिए इन्वर्स रियल-टाइम फैक्टर (RTFx) और स्ट्रीमिंग लेटेन्सी के लिए H200 GPUs और CPUs पर टाइम-टू-फर्स्ट-ऑडियो (TTFA) द्वारा मात्रात्मक रूप से व्यक्त किया जाता है।
  • स्पीकर समानता को जनरेटेड ऑडियो और रेफरेंस क्लिप के WavLM एम्बेडिंग्स के बीच कॉसाइन सिमिलैरिटी का उपयोग करके गणना की जाती है।
  • प्लेटफ़ॉर्म मल्टीलिंगुअल इवैल्यूएशन को सपोर्ट करता है, अंग्रेजी WER और चीनी, जापानी और कोरियन के लिए अक्षर-आधारित स्कोर के बीच टॉगल करने की सुविधा देता है।
  • एक "Listen" टैब उपयोगकर्ताओं को आउटपुट की तुलना करने और प्राथमिकताओं पर वोट करने की अनुमति देता है, जबकि एक "Streaming" टैब इंटरैक्टिव एप्लिकेशन के लिए TTFA के आधार पर मॉडल को रैंक करता है।

लीडरबोर्ड का उद्देश्य तेजी से जारी होने वाले TTS रिलीज़ के साथ तालमेल बनाए रखना और व्यावसायिक एरीना में अक्सर कम दिखाई देने वाले ओपन-सोर्स मॉडल को हाइलाइट करना है, भविष्य की मेट्रिक्स और डेटासेट्स को आकार देने के लिए समुदाय से प्रतिक्रिया आमंत्रित करता है।