开放TTS排行榜已发布,旨在通过使用客观指标而非仅依赖缓慢的竞技场式人类偏好评分,解决语音合成(TTS)评估中的碎片化和缺乏标准化问题。它使用Qwen3 ASR和WavLM嵌入来评估模型的可懂度、速度和说话人相似度。
- 可懂度通过提示与生成音频转录之间的词/字错误率(WER/CER)进行衡量。
- 速度通过批量离线推理的逆实时因子(RTFx)以及H200 GPU和CPU上流式传输的首个音频时间(TTFA)进行量化。
- 说话人相似度通过生成音频与参考片段的WavLM嵌入之间的余弦相似度计算得出。
- 该平台支持多语言评估,可在英语WER和中文、日语、韩语的字级评分之间切换。
- “聆听”标签页允许用户比较输出并投票选择偏好,而“流式传输”标签页则根据TTFA对模型进行排名,适用于交互式应用。
该排行榜旨在跟上TTS快速发布的步伐,并突出显示在商业竞技场中常被忽视的开源模型,邀请社区反馈以塑造未来的指标和数据集。