Googleは2つの新しいテキスト読み上げモデル、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSをリリースし、クリエイター、開発者、企業向けに動的な音声生成機能を提供するGemini Audioファミリーを拡大しました。
- Gemini 3.8 Flash TTSは深い創造的な方向性を可能にし、ユーザーが自然言語のプロンプトを使用してゼロから新しい音声を生成し、パフォーマンスの指示を各行ごとに制御できます。
- Gemini 3.8 Flash-Lite TTSは、高ボリュームでコスト効率の高いスケーリングに最適化されており、トーンとペースの細かな制御を持つ吹き替えや表現豊かな音声エージェントをサポートします。
- これらのモデルは、メキシコスペイン語やスコットランド英語などの地域変種を含む100以上の言語と言語圏をサポートし、2,000以上の本番環境対応の音声ライブラリを提供します。
- 音声複製機能により、ユーザーは30秒のサンプルから音声プロファイルを再現でき、同意確認、SynthID透かし、C2PA認証情報によって裏付けられています。
- 両モデルともHume AIのベンチマークで上位ポジションを獲得し、Gemini 3.8 Flash TTSは総合品質インデックスと音声デザインベンチマークで首位となりました。
これらのツールは現在、開発者向けにGoogle AI StudioおよびGemini APIで利用可能であり、エンタープライズ向けのアクセスもまもなくGemini Enterpriseを通じて提供されます。