Google 为其最新的 Gemini 模型引入了代理式视频理解功能,支持动态分析,可将令牌使用量减少高达 88%,同时将准确率提高高达 7%。该功能使模型能够主动搜索和检查特定的视频片段,而不是以固定速率处理帧。

该功能可通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 获得。关键功能包括亚秒级时刻检索、长文本“大海捞针”式搜索、异常检测和动作及物体的精确计数。早期访问合作伙伴报告称性能强劲,其中 Gemini 3.7 Flash 实现了最佳的准确率与成本效率比。

Google 计划在未来几个月内将这些改进推广至数十亿用户的 Gemini 应用,并用于支持 YouTube 的“Ask YouTube”功能。