Google发布了两个新的文本转语音模型:Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,作为其Gemini Audio系列的一部分。这些模型引入了通过自然语言提示进行生成式语音设计,并通过Gemini API和Google AI Studio实现逐行表演指导。

  • Gemini 3.8 Flash TTS面向游戏和沉浸式媒体的创意方向,在Hume AI语音设计基准测试中排名第一,得分为71.4。
  • Gemini 3.8 Flash-Lite TTS针对高容量、成本效益高的制作(如配音)进行了优化,在Hume AI整体质量指数中排名第二。
  • 此次发布将语音库扩展至超过2,000个可直接投入生产的语音,并支持100多种语言的生成式设计。
  • 两个模型均支持原生双角色舞台表现、声音爆发、后台回应以及长篇幅生成,且保持一致的质量。
  • 语音复制需要30秒样本和口头同意,所有输出均由SynthID添加水印。

这些模型为开发者提供了对语气、节奏和角色设计的细粒度控制,同时针对不同制作需求提供可扩展的选项。