शोधकर्ताओं ने SCOUT का प्रस्ताव रखा है, एक फ्रेमवर्क जो संरचित चेन-ऑफ़-थॉट (Chain-of-Thought) को बहु-उद्देश्यीय प्रक्रिया-पुरस्कार पुनर्बल सीखने (multi-objective process-reward reinforcement learning) के साथ मिलाकर विज़न-लैंग्वेज मॉडल्स की स्थानिक तर्कशक्ति को बढ़ाता है। यह दृष्टिकोण मौजूदा RL तरीकों में क्रेडिट असाइनमेंट की समस्याओं को हल करता है और व्यापक 3D समझ के लिए गहराई का अनुभव (depth perception) एकीकृत करता है।

  • SCOUT स्पष्ट रूप से 3D पर्यावरणिक धारणा को मॉडल करने के लिए एक संरचित CoT फ्रेमवर्क पेश करता है।
  • इस विधि में सूक्ष्म क्रेडिट असाइनमेंट के लिए बहु-उद्देश्यीय प्रक्रिया पुरस्कार और अनुकूलित लाभ अनुमान (advantage estimation) वाले एक नए RL एल्गोरिदम का उपयोग किया जाता है।
  • प्रशिक्षण को समर्थन देने के लिए SCOUT-24k नामक एक नया डेटासेट एक अनुकूलित पाइपलाइन के माध्यम से संश्लेषित किया गया था।
  • सामान्य स्थानिक मानकों पर SCOUT-3B ने बेसलाइनों की तुलना में 16.85% और जटिल कार्यों पर 6.3% सुधार दिखाया है।
  • बड़ा SCOUT-7B मॉडल केवल एकल छवियों पर प्रशिक्षित होने के बावजूद GPT-4o से 4.28% बेहतर प्रदर्शन करता है।

लेखक SCOUT को अगली पीढ़ी की स्थानिक-जागरूक VLMs की ओर एक महत्वपूर्ण कदम मानते हैं, जो बहु-छवि और वीडियो परिदृश्यों में मजबूत आउट-ऑफ़-डोमेन सामान्यीकरण (out-of-domain generalization) प्रदर्शित करता है।