Google 通过 Gemini API 和 AI Studio 发布了 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,在 Hume 的 Voice Design Benchmark 和 Voice Arena 六个语言中均名列前茅。
- 用户现在可以通过录制两个经同意的片段来复制语音,或仅凭单个句子设计新语音,无需先前录音。
- API 支持内联音效(如 <short pause>)以及通过 speech_metadata.style 提供的详细交付风格。
- 复制的语音可重复使用,而未获同意的语音可作为加密密钥存储,七天后过期。
- 提示方式发生了显著变化:文本内的指令会被朗读出来,多说话人轮次需要明确的说话人标签,且长 Audio Profile 提示可能导致语音漂移。
此次更新允许对合成语音生成进行精确控制,但来自 gemini-3.1-flash-tts-preview 版本的现有提示若不迁移将会失效。