Open TTS Leaderboardは、Text-to-Speech (TTS) 評価における断片化と標準化の欠如に対処するため、遅くアリーナベースの人間による好みスコアに依存するのではなく、客観的な指標を使用してリリースされました。Qwen3 ASRおよびWavLM埋め込みを用いて、明瞭性、速度、話者類似性の各モデルを評価します。
- 明瞭性は、プロンプトと生成された音声の文字列間の単語誤り率(WER)/文字誤り率(CER)によって測定されます。
- 速度は、バッチ処理オフライン推論における逆リアルタイム係数(RTxF)およびH200 GPUおよびCPUでのストリーミングレイテンシにおける初回音声到達時間(TTFA)によって定量化されます。
- 話者類似性は、生成された音声と参照クリップのWavLM埋め込み間のコサイン類似度を用いて計算されます。
- このプラットフォームは多言語評価をサポートしており、英語のWERと中国語、日本語、韓国語の文字ベーススコアを切り替えることができます。
- 「Listen」タブによりユーザーは出力を比較し、好みの投票を行うことができ、「Streaming」タブではインタラクティブアプリケーション向けにTTFAでモデルがランク付けされます。
このリーダーボードは、急速なTTSリリースのペースに追いつき、商業用アリーナでしばしば過小評価されているオープンソースモデルを強調することを目的としており、将来の指標とデータセット形成に向けたコミュニティからのフィードバックを呼びかけています。