Les chercheurs présentent Video-DeepResearch (Video-DR), un cadre étendant les agents multimodaux des images statiques aux flux vidéo continus, en s'attaquant au biais de modalité et à la fuite de connaissances paramétriques. Le système utilise un pipeline de perception-exploration découplé avec un déverrouillage progressif des outils pour imposer l'ancrage visuel inter-images avant la récupération web.
- L'entraînement utilise un affinage fin supervisé suivi d'une optimisation de politique relative par groupe (GRPO) pour permettre l'exploration autonome.
- Un nouveau benchmark, Video-DR-Bench, comprenant 200 instances VQA multi-sauts complexes, est conçu pour l'évaluation.
- Le modèle Video-DeepResearch-35B-A3B atteint une précision moyenne de pointe de 64,0 % sur le benchmark.
- Cette performance dépasse Claude-4.5-Sonnet (59,0 %), GPT-5 (52,5 %) et Gemini 2.5 Pro (57,5 %).
Le cadre démontre que son paradigme d'entraînement est efficace même à des échelles compactes, la variante 30B-A3B atteignant une précision de 59,3 %.