Googleは、そのGemini Audioファミリーの一環として、2つの新しいテキスト読み上げモデルであるGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSをリリースした。これらのモデルは、自然言語のプロンプトからの生成型音声デザインや、Gemini APIおよびGoogle AI Studioを通じた行ごとのパフォーマンス指示を導入している。

  • Gemini 3.8 Flash TTSはゲームや没入型メディア向けのクリエイティブな方向性を対象としており、Hume AI Voice Design Benchmarkで71.4のスコアを獲得し、第1位にランクインした。
  • Gemini 3.8 Flash-Lite TTSは吹き替えなど、高ボリュームかつコスト効率の良い制作向けに最適化されており、Hume AI Overall Quality Indexで第2位にランクインしている。
  • このリリースにより、生産環境での使用が可能な音声ライブラリが2,000件を超え、100以上の言語で生成型デザインが可能になった。
  • 両モデルとも、ネイティブな2話者構成、ボーカルバースト、バックチャネリング、そして一貫した品質を維持する長尺の生成に対応している。
  • 音声複製には30秒間のサンプルと口頭での同意が必要であり、すべての出力はSynthIDによって透かし処理される。

これらのモデルは、開発者に対してトーン、ペース、キャラクターデザインの詳細な制御を提供しつつ、さまざまな制作ニーズに応じたスケーラブルなオプションを提供している。