오픈 TTS 리더보드는 느린 아레나 기반 인간 선호도 점수에 의존하는 대신 객관적 지표를 사용하여 텍스트 음성 변환(TTS) 평가의 단편화와 표준화 부재를 해결하기 위해 출시되었습니다. 이 리더보드는 Qwen3 ASR과 WavLM 임베딩을 사용하여 모델의 가청성, 속도 및 화자 유사성을 평가합니다.

  • 가청성은 프롬프트와 생성된 오디오 트랜스크립트 간의 단어/문자 오류율(WER/CER)을 통해 측정됩니다.
  • 속도는 배치 오프라인 추론을 위한 역 실시간 계수(RTxF)와 H200 GPU 및 CPU에서의 스트리밍 지연 시간을 위한 첫 오디오까지의 시간(TTFA)으로 정량화됩니다.
  • 화자 유사성은 생성된 오디오와 참조 클립의 WavLM 임베딩 간 코사인 유사성을 사용하여 계산됩니다.
  • 이 플랫폼은 다국어 평가를 지원하며, 영어 WER과 중국어, 일본어, 한국어의 문자 기반 점수 간 전환을 제공합니다.
  • "Listen" 탭을 통해 사용자는 출력을 비교하고 선호도에 투표할 수 있으며, "Streaming" 탭은 상호작용 애플리케이션을 위해 TTFA 기준으로 모델을 랭킹합니다.

이 리더보드는 빠른 TTS 출시 속도에 발맞추고 상업적 아레나에서 종종 과소평가된 오픈소스 모델을 부각시키며, 향후 지표와 데이터셋 형성에 커뮤니티 피드백을 환영합니다.