Se ha publicado el ranking Open TTS para abordar la fragmentación y la falta de estandarización en la evaluación del texto a voz (TTS), utilizando métricas objetivas en lugar de depender únicamente de puntuaciones lentas de preferencia humana basadas en arenas. Evalúa modelos en inteligibilidad, velocidad y similitud del hablante mediante incrustaciones de Qwen3 ASR y WavLM.

  • La inteligibilidad se mide mediante la tasa de error de palabras/caracteres (WER/CER) entre el texto de entrada y la transcripción del audio generado.
  • La velocidad se cuantifica por el factor inverso en tiempo real (RTFx) para inferencia offline por lotes y el tiempo hasta el primer audio (TTFA) para la latencia en streaming en GPUs H200 y CPUs.
  • La similitud del hablante se calcula mediante la similitud del coseno entre las incrustaciones de WavLM del audio generado y el clip de referencia.
  • La plataforma admite evaluación multilingüe, alternando entre WER en inglés y puntuaciones basadas en caracteres para chino, japonés y coreano.
  • Una pestaña "Escuchar" permite a los usuarios comparar salidas y votar por sus preferencias, mientras que una pestaña "Streaming" clasifica los modelos por TTFA para aplicaciones interactivas.

El ranking tiene como objetivo mantenerse al día con el rápido lanzamiento de TTS y destacar los modelos de código abierto que a menudo están infrarrepresentados en las arenas comerciales, invitando a la retroalimentación de la comunidad para dar forma a futuras métricas y conjuntos de datos.