Исследователи представляют Video-DeepResearch (Video-DR), фреймворк, расширяющий возможности мультимодальных агентов со статических изображений на непрерывные видеопотоки, решая проблемы модальности и утечки параметрических знаний. Система использует разделенный конвейер восприятия и исследования с поэтапным разблокированием инструментов для обеспечения перекрестного визуального обоснования между кадрами перед поиском в веб-сети.
- Обучение использует контролируемое тонкое настраивание, за которым следует Group Relative Policy Optimization (GRPO) для автономного исследования.
- Новый бенчмарк Video-DR-Bench, состоящий из 200 сложных многошаговых VQA экземпляров, создан для оценки.
- Модель Video-DeepResearch-35B-A3B достигает наивысшей средней точности 64.0% на этом бенчмарке.
- Этот результат превосходит Claude-4.5-Sonnet (59.0%), GPT-5 (52.5%) и Gemini 2.5 Pro (57.5%).
Фреймворк демонстрирует, что его парадигма обучения эффективна даже на компактных масштабах, где вариант 30B-A3B достигает точности 59.3%.