يقدم الباحثون Video-DeepResearch (Video-DR)، وهو إطار عمل يمدد الوكلاء متعددي الوسائط من الصور الثابتة إلى تدفقات الفيديو المستمرة، مما يعالج تحيز الوسائط وتسرب المعرفة البارامترية. يعتمد النظام على خط أنابيب لفصل الاستكشاف عن الإدراك مع فتح الأدوات تدريجيًا لضمان التأسيس البصري عبر الإطارات قبل البحث في الويب.

  • يستخدم التدريب ضبطًا دقيقًا خاضعًا للإشراف يليه تحسين السياسة النسبية للمجموعة (GRPO) لتمكين الاستكشاف المستقل.
  • تم إعداد مقياس تقييم جديد هو Video-DR-Bench، يتكون من 200 حالة معقدة متعددة الخطوات لأسئلة وإجابات حول الفيديو.
  • يحقق نموذج Video-DeepResearch-35B-A3B دقة متوسطة قياسية تبلغ 64.0% على المقياس.
  • تتفوق هذه الأداء على Claude-4.5-Sonnet (59.0%)، وGPT-5 (52.5%)، وGemini 2.5 Pro (57.5%).

يُظهر الإطار أن منهج تدريبه فعال حتى عند المقاييس المدمجة، حيث حقق المتغير 30B-A3B دقة تبلغ 59.3%.