Google发布了两个新的文本转语音模型:Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,将Gemini Audio系列扩展至为创作者、开发者和企业提供动态语音生成能力。
- Gemini 3.8 Flash TTS支持深度创意导向,允许用户通过自然语言提示从零创建新声音,并逐行控制表演提示。
- Gemini 3.8 Flash-Lite TTS针对高吞吐量、成本高效的规模化场景进行了优化,支持配音和具有精细音调与节奏控制的表达性语音代理。
- 这些模型支持100多种语言和方言,包括墨西哥西班牙语和苏格兰英语等地域变体,并提供2,000多个可直接投入生产使用的声音库。
- 声音复制功能允许用户基于30秒样本重建声纹档案,并获得同意验证、SynthID水印以及C2PA凭证的支持。
- 两款模型均在Hume AI的基准测试中取得顶尖成绩,其中Gemini 3.8 Flash TTS在整体质量指数和语音设计基准中均位列第一。
这些工具现已在Google AI Studio和Gemini API中对开发者开放,企业访问权限即将通过Gemini Enterprise推出。