Google 已在所有 Gemini Flash 模型中推出了代理式视频理解功能,取代了之前的静态处理方式,该系统能够按需浏览视频时间线。这一变化使模型能够自主决定观看内容、帧率以及通过哪种模态进行处理,而非以每秒一帧的固定速率摄入整个时间线。

  • 新方法将 token 使用量最高减少 88%,成本最高降低 66%,同时在标准视频基准测试中将准确率最高提升 7%。
  • 具备代理式理解能力的 Gemini 3.7 Flash 在已测试模型中,于视频分析的准确率-成本帕累托前沿上占据领先地位。
  • 该功能通过 API 中的单个 "processing" 字段启用,支持文件上传和公共 YouTube URL。
  • Token 统计区分了导航推理(思考 token)与加载的媒体(工具使用 token)。

此次更新使开发者能够更高效地处理长格式内容,而无需承担手动组装处理循环所带来的开发开销,尽管对于五分钟以下的片段仍推荐使用静态处理方式。