연구자들은 Video-DeepResearch (Video-DR)를 소개했는데, 이는 정적 이미지에서 연속 비디오 스트림으로 멀티모달 에이전트를 확장하는 프레임워크로, 모달 편향과 매개변수 지식 누수를 해결합니다. 이 시스템은 웹 검색 전에 프레임 간 시각적 기반을 확립하기 위해 단계별 도구 잠금 해제와 함께 분리된 지각-탐색 파이프라인을 사용합니다.

  • 훈련은 자율 탐색을 가능하게 하기 위해 감독 세밀 튜닝 후 Group Relative Policy Optimization (GRPO)를 활용합니다.
  • 평가를 위해 200개의 복잡한 다중 홉 VQA 인스턴스로 구성된 새로운 벤치마크인 Video-DR-Bench가 준비되었습니다.
  • Video-DeepResearch-35B-A3B 모델은 벤치마크에서 최고 성능의 64.0% 평균 정확도를 달성했습니다.
  • 이 성능은 Claude-4.5-Sonnet (59.0%), GPT-5 (52.5%), Gemini 2.5 Pro (57.5%)를 능가합니다.

이 프레임워크는 30B-A3B 변형체가 59.3%의 정확도를 달성하는 등, 훈련 패러다임이 컴팩트한 규모에서도 효과적임을 보여줍니다.