研究人员推出了 Video-DeepResearch (Video-DR),这是一个将 multimodal agent 从静态图像扩展到连续视频流的框架,旨在解决模态偏差和参数知识泄漏问题。该系统采用解耦的感知-探索流水线,并通过分阶段解锁工具,在网页检索之前强制实现跨帧视觉定位。
- 训练利用监督微调(SFT)后接 Group Relative Policy Optimization (GRPO),以实现自主探索。
- 为评估而精心策划了一个新基准 Video-DR-Bench,包含 200 个复杂的多跳 VQA 实例。
- Video-DeepResearch-35B-A3B 模型在该基准上取得了 64.0% 的平均准确率,达到最先进水平。
- 该性能超越了 Claude-4.5-Sonnet (59.0%)、GPT-5 (52.5%) 和 Gemini 2.5 Pro (57.5%)。
该框架表明,其训练范式即使在紧凑规模下也有效,其中 30B-A3B 变体达到了 59.3% 的准确率。