Los investigadores presentan Video-DeepResearch (Video-DR), un marco que extiende los agentes multimodales desde imágenes estáticas a flujos de video continuos, abordando el sesgo de modalidad y la fuga de conocimiento paramétrico. El sistema emplea una pipeline de percepción-exploración desacoplada con desbloqueo progresivo de herramientas para garantizar la fundamentación visual entre fotogramas antes de la recuperación web.
- El entrenamiento utiliza ajuste fino supervisado seguido de Group Relative Policy Optimization (GRPO) para permitir la exploración autónoma.
- Se ha curado un nuevo benchmark, Video-DR-Bench, que comprende 200 instancias complejas de VQA multi-hop, para la evaluación.
- El modelo Video-DeepResearch-35B-A3B alcanza una precisión promedio de vanguardia del 64.0% en el benchmark.
- Este rendimiento supera a Claude-4.5-Sonnet (59.0%), GPT-5 (52.5%) y Gemini 2.5 Pro (57.5%).
El marco demuestra que su paradigma de entrenamiento es efectivo incluso a escalas compactas, con la variante 30B-A3B logrando una precisión del 59.3%.