शोधकर्ताओं ने Video-DeepResearch (Video-DR) पेश किया है, जो स्थिर छवियों से निरंतर वीडियो स्ट्रीम तक बहुआयामी एजेंटों को विस्तारित करने वाला एक ढांचा है, जो मोडालिटी पूर्वाग्रह और पैरामीट्रिक ज्ञान लीक होने की समस्याओं को दूर करता है। सिस्टम क्रॉस-फ्रेमल दृश्य आधार को वेब पुनर्प्राप्ति से पहले लागू करने के लिए चरण-दर-चरण टूल अनलॉकिंग के साथ एक अलग संवेदन-अन्वेषण पाइपलाइन का उपयोग करता है।

  • प्रशिक्षण में स्वतंत्र अन्वेषण सक्षम बनाने के लिए पर्यवेक्षित सूक्ष्म-अनुकूलन (SFT) के बाद समूह सापेक्ष नीति अनुकूलन (GRPO) का उपयोग किया जाता है।
  • मूल्यांकन के लिए 200 जटिल बहु-चरण VQA उदाहरणों वाले नए बेंचमार्क Video-DR-Bench को तैयार किया गया है।
  • Video-DeepResearch-35B-A3B मॉडल ने बेंचमार्क पर 64.0% औसत सटीकता के साथ शीर्ष प्रदर्शन हासिल किया है।
  • यह प्रदर्शन Claude-4.5-Sonnet (59.0%), GPT-5 (52.5%), और Gemini 2.5 Pro (57.5%) से बेहतर है।

ढांचा दर्शाता है कि इसका प्रशिक्षण पैराडाइम छोटे पैमाने पर भी प्रभावी है, जहाँ 30B-A3B वेरिएंट ने 59.3% सटीकता हासिल की है।