研究者らは、Video-DeepResearch (Video-DR) を導入した。これは、マルチモーダルエージェントを静止画像から連続動画ストリームへと拡張するフレームワークであり、モダリティバイアスとパラメトリックな知識の漏洩に対処する。
このシステムは、段階的なツール解放による分離された知覚・探索パイプラインを採用し、ウェブ検索の前にフレーム間視覚的グラウンディングを強制する。
- 学習には、教師ありファインチューニングに続き、自律的探索を可能にするためのGroup Relative Policy Optimization (GRPO) が利用される。
- 評価用に、200件の複雑なマルチホップVQAインスタンスで構成される新しいベンチマークVideo-DR-Benchが構築された。
- Video-DeepResearch-35B-A3Bモデルは、このベンチマークで64.0%の平均精度という最先端の結果を達成した。
- この性能はClaude-4.5-Sonnet (59.0%)、GPT-5 (52.5%)、Gemini 2.5 Pro (57.5%) を上回る。
このフレームワークは、その学習パラダイムがコンパクトなスケールでも有効であることを示しており、30B-A3Bバリアントは59.3%の精度を達成した。