阿里巴巴的通义实验室发布了Qwen-Audio-3.0-TTS,这是一个托管的文本转语音系统,提供两种变体:用于实时交互的Flash和用于高质量生成的Plus。这两个版本均通过阿里云模型工作室提供服务,而非作为可下载的权重。

  • 该模型支持16种语言和20个中文方言区域,其中Flash的平均字/词错误率最低,为3.87。
  • Qwen-Audio-3.0-TTS-Plus在Artificial Analysis文本转语音排行榜上排名第一,Elo评分接近1,236。
  • 系统包含86个细粒度的内联标签,用于处理笑声和呼吸等非语言细节,同时支持自然语言风格控制。
  • Flash的目标首包延迟为300毫秒,而Plus侧重于音色保真度和说话人相似度,在所有16种语言中均名列前茅。

此次发布为开发者提供了强大的多语言合成能力以及通过托管API实现的细粒度音频控制。