Googleは、OpenAIのGPT-Liveモデルと形状が類似している2つの新しいスピーチ・トゥ・スピーチ モデル、Gemini 3.8 LiveとGemini 3.8 Live Extended Thinkingをリリースしました。

  • リリースには Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking が含まれます。
  • Web UI を使用すると、ユーザーはモデルと音声プリセットを選択し、オプションのシステムプロンプトを入力して、ブラウザを通じて音声会話を開始できます。
  • ユーザーはモデルが話している間にそれを中断でき、その際の中断は文字起こしに記録されます。
  • 実装は WebSocket エンドポイントに接続し、外部ライブラリなしで Web Audio API を使用してキャプチャと再生を行います。