Google 发布了两个新的语音到语音模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,其结构与 OpenAI 的 GPT-Live 模型相似。

  • 此次发布包括 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。
  • Web UI 允许用户选择模型和语音预设,输入可选的系统提示词,并通过浏览器启动语音对话。
  • 用户可以在模型说话时中断它,转录文本会记录这些中断。
  • 实现方式连接到 WebSocket 端点,并使用 Web Audio API 进行捕获和播放,无需外部库。