Google发布了两个新的文本转语音模型:gemini-3.8-flash-tts和gemini-3.8-flash-lite-tts,内置超过2000种声音库。

该API支持仅使用30秒的音频样本创建自定义声音,并允许用户定义具有不同声音风格的多说话人对话。

在测试中,生成1分18秒的音频大约耗时20秒,使用标准Flash模型的成本为2.74美分。