Google AI 发布了 Gemini 3.5 Transcribe,这是一个语音转文本模型,可通过两个不同的 API 端点使用:用于预录文件的 Interactions API 和用于实时流媒体的 Live API。
- 根据 Artificial Analysis 的测量,该模型在非流媒体场景下的平均词错误率为 2.6%,在流媒体场景下为 4.0%。
- 与之前的 Chirp 3 模型相比,最终转录完成时间缩短了 70%。
- 自动检测支持超过 85 种语言,包括句中代码切换。
- Live API 提供亚秒级延迟,但缺少说话人分离和词级时间戳,这些功能在 Interactions API 中可用。
- 智能模式可去除不流畅的语音,但不能与时间戳或说话人分离结合使用。
端点之间的划分允许开发者在用于实时界面的低延迟流媒体和用于后处理的详细转录功能之间进行选择。