Open TTS Leaderboard telah dirilis untuk mengatasi fragmentasi dan kurangnya standarisasi dalam evaluasi Text-to-Speech (TTS) dengan menggunakan metrik objektif alih-alih hanya mengandalkan skor preferensi manusia berbasis arena yang lambat. Model dievaluasi berdasarkan kejelasan, kecepatan, dan kesamaan pembicara menggunakan Qwen3 ASR dan embedding WavLM.
- Kejelasan diukur melalui word/character error rate (WER/CER) antara prompt dan transkrip audio yang dihasilkan.
- Kecepatan dikuantifikasi oleh inverse real-time factor (RTFx) untuk inferensi offline batched dan time-to-first-audio (TTFA) untuk latensi streaming pada GPU dan CPU H200.
- Kesamaan pembicara dihitung menggunakan cosine similarity antara embedding WavLM dari audio yang dihasilkan dan klip referensi.
- Platform ini mendukung evaluasi multibahasa, dengan beralih antara WER bahasa Inggris dan skor berbasis karakter untuk bahasa Mandarin, Jepang, dan Korea.
- Tab "Listen" memungkinkan pengguna membandingkan output dan memberikan suara pada preferensi, sementara tab "Streaming" peringkat model berdasarkan TTFA untuk aplikasi interaktif.
Leaderboard ini bertujuan untuk mengikuti rilis TTS yang cepat dan menyoroti model open-source yang sering kali kurang terwakili di arena komersial, mengundang umpan balik komunitas untuk membentuk metrik dan dataset di masa depan.