Pesquisadores apresentam o Video-DeepResearch (Video-DR), um framework que estende agentes multimodais de imagens estáticas para fluxos de vídeo contínuos, abordando viés de modalidade e vazamento de conhecimento paramétrico. O sistema emprega um pipeline de percepção-exploração desacoplado com desbloqueio de ferramentas por estágio para impor ancoragem visual entre quadros antes da recuperação na web.

  • O treinamento utiliza ajuste fino supervisionado seguido de Group Relative Policy Optimization (GRPO) para permitir exploração autônoma.
  • Um novo benchmark, Video-DR-Bench, composto por 200 instâncias complexas de VQA multi-hop, é curado para avaliação.
  • O modelo Video-DeepResearch-35B-A3B alcança uma precisão média de estado da arte de 64,0% no benchmark.
  • Esse desempenho supera Claude-4.5-Sonnet (59,0%), GPT-5 (52,5%) e Gemini 2.5 Pro (57,5%).

O framework demonstra que seu paradigma de treinamento é eficaz mesmo em escalas compactas, com a variante 30B-A3B alcançando 59,3% de precisão.