Google 发布了 Gemini 3.5 Transcribe,这是一款专为智能语音交互设计的语音转文本模型,可将原始音频转换为准确、精炼的文本,同时处理背景噪音和口误。

  • 根据 Artificial Analysis 的测量,流式传输的平均词错误率(WER)为 4.0%,非流式用例为 2.6%。
  • 与之前的 Chirp 3 模型相比,最终转录时间缩短了 70%。
  • 支持超过 85 种语言,具备自动检测功能,并处理专业术语的自定义词汇表。
  • 通过 Live API 提供实时流式传输,并通过 Interactions API 提供预录制音频处理。
  • 支持函数调用,可将图像生成等任务委托给其他 Gemini 模型。

该模型可通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform 以公开预览形式使用。