Google 发布了两个新的语音到语音模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,其结构与 OpenAI 的 GPT-Live 模型相似。
- 此次发布包括 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。
- Web UI 允许用户选择模型和语音预设,输入可选的系统提示词,并通过浏览器启动语音对话。
- 用户可以在模型说话时中断它,转录文本会记录这些中断。
- 实现方式连接到 WebSocket 端点,并使用 Web Audio API 进行捕获和播放,无需外部库。