शोधकर्ताओं ने Video-DeepResearch (Video-DR) पेश किया है, जो स्थिर छवियों से निरंतर वीडियो स्ट्रीम तक बहुआयामी एजेंटों को विस्तारित करने वाला एक ढांचा है, जो मोडालिटी पूर्वाग्रह और पैरामीट्रिक ज्ञान लीक होने की समस्याओं को दूर करता है। सिस्टम क्रॉस-फ्रेमल दृश्य आधार को वेब पुनर्प्राप्ति से पहले लागू करने के लिए चरण-दर-चरण टूल अनलॉकिंग के साथ एक अलग संवेदन-अन्वेषण पाइपलाइन का उपयोग करता है।
- प्रशिक्षण में स्वतंत्र अन्वेषण सक्षम बनाने के लिए पर्यवेक्षित सूक्ष्म-अनुकूलन (SFT) के बाद समूह सापेक्ष नीति अनुकूलन (GRPO) का उपयोग किया जाता है।
- मूल्यांकन के लिए 200 जटिल बहु-चरण VQA उदाहरणों वाले नए बेंचमार्क Video-DR-Bench को तैयार किया गया है।
- Video-DeepResearch-35B-A3B मॉडल ने बेंचमार्क पर 64.0% औसत सटीकता के साथ शीर्ष प्रदर्शन हासिल किया है।
- यह प्रदर्शन Claude-4.5-Sonnet (59.0%), GPT-5 (52.5%), और Gemini 2.5 Pro (57.5%) से बेहतर है।
ढांचा दर्शाता है कि इसका प्रशिक्षण पैराडाइम छोटे पैमाने पर भी प्रभावी है, जहाँ 30B-A3B वेरिएंट ने 59.3% सटीकता हासिल की है।