Les chercheurs présentent Video-DeepResearch (Video-DR), un cadre étendant les agents multimodaux des images statiques aux flux vidéo continus, en s'attaquant au biais de modalité et à la fuite de connaissances paramétriques. Le système utilise un pipeline de perception-exploration découplé avec un déverrouillage progressif des outils pour imposer l'ancrage visuel inter-images avant la récupération web.

  • L'entraînement utilise un affinage fin supervisé suivi d'une optimisation de politique relative par groupe (GRPO) pour permettre l'exploration autonome.
  • Un nouveau benchmark, Video-DR-Bench, comprenant 200 instances VQA multi-sauts complexes, est conçu pour l'évaluation.
  • Le modèle Video-DeepResearch-35B-A3B atteint une précision moyenne de pointe de 64,0 % sur le benchmark.
  • Cette performance dépasse Claude-4.5-Sonnet (59,0 %), GPT-5 (52,5 %) et Gemini 2.5 Pro (57,5 %).

Le cadre démontre que son paradigme d'entraînement est efficace même à des échelles compactes, la variante 30B-A3B atteignant une précision de 59,3 %.