O Leaderboard Open TTS foi lançado para abordar a fragmentação e a falta de padronização na avaliação de Text-to-Speech (TTS), utilizando métricas objetivas em vez de depender exclusivamente de pontuações lentas de preferência humana baseadas em arenas. Ele avalia modelos quanto à inteligibilidade, velocidade e similaridade do locutor usando embeddings Qwen3 ASR e WavLM.
- A inteligibilidade é medida pela taxa de erro de palavra/caractere (WER/CER) entre o prompt e a transcrição do áudio gerado.
- A velocidade é quantificada pelo fator real-time inverso (RTFx) para inferência offline em lote e tempo até o primeiro áudio (TTFA) para latência de streaming em GPUs H200 e CPUs.
- A similaridade do locutor é calculada usando a similaridade cosseno entre os embeddings WavLM do áudio gerado e do clipe de referência.
- A plataforma suporta avaliação multilíngue, alternando entre WER em inglês e pontuações baseadas em caracteres para chinês, japonês e coreano.
- Uma aba "Listen" permite que os usuários comparem as saídas e votem nas preferências, enquanto uma aba "Streaming" classifica os modelos por TTFA para aplicações interativas.
O leaderboard visa acompanhar o rápido lançamento de novos TTSs e destacar modelos de código aberto frequentemente sub-representados em arenas comerciais, convidando feedback da comunidade para moldar métricas e conjuntos de dados futuros.