Google 发布了 Gemini 3.5 Transcribe,这是一款专为智能语音交互设计的语音转文本模型,可将原始音频转换为准确、精炼的文本,同时处理背景噪音和口误。
- 根据 Artificial Analysis 的测量,流式传输的平均词错误率(WER)为 4.0%,非流式用例为 2.6%。
- 与之前的 Chirp 3 模型相比,最终转录时间缩短了 70%。
- 支持超过 85 种语言,具备自动检测功能,并处理专业术语的自定义词汇表。
- 通过 Live API 提供实时流式传输,并通过 Interactions API 提供预录制音频处理。
- 支持函数调用,可将图像生成等任务委托给其他 Gemini 模型。
该模型可通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform 以公开预览形式使用。