总部位于巴黎的语音AI公司Gradium推出了Voice Design功能,该功能可根据书面描述生成新的合成语音,无需参考音频。该工具现已在Gradium API和Studio中上线,支持五种语言。

  • 用户输入1至500个字符的描述,详细说明性别、年龄、口音和音高等属性,可在3到5秒内获得最多5个语音候选项。
  • 候选语音通过四次调用的REST流程生成,选定的语音可使用与克隆共享的一个插槽升级为永久自定义语音槽位。
  • 在涵盖7,627次比较的盲听配对测试中,Gradium以72.6%的胜率击败了ElevenLabs和Inworld等竞争对手。
  • 该系统是非确定性的,意味着相同的提示每次都会产生不同的结果,且未保存的候选语音在30天后过期。

这使得开发人员能够按需创建特定的语音角色,而无需获取真实说话人的授权或同意。