Le classement Open TTS a été publié pour répondre à la fragmentation et au manque de standardisation dans l'évaluation de la synthèse vocale (TTS) en utilisant des métriques objectives plutôt que de se fier uniquement aux scores de préférence humaine basés sur des arènes, qui sont lents. Il évalue les modèles sur l'intelligibilité, la vitesse et la similarité du locuteur en utilisant les embeddings Qwen3 ASR et WavLM.

  • L'intelligibilité est mesurée par le taux d'erreur de mots/caractères (WER/CER) entre la consigne et la transcription audio générée.
  • La vitesse est quantifiée par le facteur temps réel inverse (RTFx) pour l'inférence hors ligne par lots et le temps jusqu'à la première audio (TTFA) pour la latence en streaming sur les GPU H200 et les CPU.
  • La similarité du locuteur est calculée à l'aide de la similarité cosinus entre les embeddings WavLM de l'audio généré et de la référence.
  • La plateforme prend en charge l'évaluation multilingue, permettant de basculer entre le WER anglais et les scores basés sur les caractères pour le chinois, le japonais et le coréen.
  • Un onglet « Écouter » permet aux utilisateurs de comparer les sorties et de voter pour leurs préférences, tandis qu'un onglet « Streaming » classe les modèles par TTFA pour les applications interactives.

Le classement vise à suivre le rythme rapide des nouvelles versions TTS et à mettre en lumière les modèles open-source souvent sous-représentés dans les arènes commerciales, invitant la communauté à fournir des retours pour façonner les futures métriques et ensembles de données.