Cartesia发布了其最新实时文本转语音模型Sonic-3.6,该模型目前在Artificial Analysis的两个语音排行榜上均位居第一。此次更新侧重于提升自然度,并采用状态空间模型而非Transformer架构,以实现低于90毫秒的首音延迟。

  • Sonic-3.6在Provider Voice榜单上获得1,283 Elo分,在Controlled Voice榜单上也获得1,283 Elo分。
  • 该模型可通过Cartesia的托管API以测试版形式使用,但不提供自托管权重。
  • 关键生产功能包括内联表情标签、仅需10秒音频即可实现的即时语音克隆,以及对原生字母数字字符的支持。
  • Artificial Analysis将其定价标准化为每100万字符49.00美元,仅为ElevenLabs Eleven v3成本的一半。

此次发布提供了一款可商业部署的流式TTS解决方案,在低延迟与高自然度之间取得平衡,适用于客户支持和媒体本地化等应用场景。