Googleは、2,000以上のボイスライブラリを備えた2つの新しいテキスト読み上げモデル、gemini-3.8-flash-ttsおよびgemini-3.8-flash-lite-ttsをリリースしました。
APIでは、わずか30秒の音声サンプルを使用してカスタムボイスを作成することができ、ユーザーは異なる音声スタイルを持つマルチスピーカーの会話を定義することも可能です。
テストでは、1分18秒分の音声を生成するのに約20秒かかり、標準的なFlashモデルを使用した場合のコストは2.74セントでした。