Google は Gemini API と AI Studio を介して Gemini 3.8 Flash TTS および Flash-Lite TTS をリリースし、Hume の Voice Design Benchmark および Voice Arena で6言語でトップランクを達成しました。

  • ユーザーは、同意に基づく2つのクリップを録音することで音声を複製するか、既存の録音なしで1文から新しい音声を作成できるようになりました。
  • API は <short pause> などのインライン効果音と、speech_metadata.style を介した詳細な発話スタイルをサポートします。
  • 複製された音声は再利用可能ですが、同意のない音声は7日後に期限切れになる暗号化キーとして保存できます。
  • プロンプティングが大幅に変更されました:テキスト内の指示は読み上げられ、複数話者のターンには明示的な話者タグが必要で、長い Audio Profile プロンプトは音声ドリフトを引き起こす可能性があります。

このアップデートにより合成音声生成の精密な制御が可能になりますが、gemini-3.1-flash-tts-preview バージョンからの既存プロンプトは移行なしで壊れます。