알리바바의 퉁이 연구소는 두 가지 변형 버전으로 제공되는 호스팅 텍스트 음성 변환 시스템인 Qwen-Audio-3.0-TTS를 출시했습니다: 실시간 상호작용을 위한 Flash와 고품질 생성을 위한 Plus. 두 등급 모두 다운로드 가능한 가중치 대신 알리바바 클라우드 모델 스튜디오를 통해 제공됩니다.

  • 이 모델은 16개 언어와 20개 중국어 방언 지역을 지원하며, Flash는 평균 단어/문자 오류율이 3.87로 가장 낮습니다.
  • Qwen-Audio-3.0-TTS-Plus는 Elo 점수가 약 1,236으로 인공 분석 텍스트 음성 변환 리더보드에서 1위를 차지했습니다.
  • 이 시스템에는 웃음과 호흡 같은 비언어적 세부 사항에 대한 86개의 세밀한 인라인 태그와 자연어 스타일 제어가 포함되어 있습니다.
  • Flash는 첫 번째 패킷 지연 시간을 300 ms로 목표로 하며, Plus는 음색 충실도와 화자 유사성에 중점을 두고 모든 16개 언어에서 상위권을 차지합니다.

이번 출시는 개발자들에게 호스팅 API를 통해 강력한 다국어 합성 기능과 세밀한 오디오 제어를 제공합니다.