शोधकर्ताओं ने दृश्य-भाषा मॉडलों में "थिंकिंग-एक्टिंग गैप" को संबोधित करने के लिए एजेंट एक्सप्लोरेटिव पॉलिसी ऑप्टिमाइज़ेशन (AXPO) का प्रस्ताव दिया है, जिन्हें बाहरी उपकरणों की आवश्यकता होती है। यह गैप GRPO जैसे मानक RL विधियों को केवल ~30% रोलआउट्स पर उपकरण उपयोग करने के लिए प्रेरित करता है, जिसमें उच्च विफलता दरें सीखने के संकेतों को दबा देती हैं।

  • AXPO सभी-गलत उपसमूहों के लिए थिंकिंग प्राफ़िक्स को ठीक करता है और टूल कॉल को पुनः सैंपल करता है, जो अनिश्चितता-आधारित प्राफ़िक्स चयन के साथ जुड़ा होता है।
  • Qwen3-VL-Thinking के नौ मल्टीमोडल बेंचमार्क और तीन स्केल पर मूल्यांकन किया गया।
  • 8B पर औसतन SFT+AXPO, SFT+GRPO से +1.8pp Pass@1 और +1.8pp Pass@4 में बेहतर प्रदर्शन करता है।
  • SFT+AXPO का उपयोग करने वाला एक 8B मॉडल, चार गुना कम पैरामीटर के साथ Pass@4 पर एक 32B बेस मॉडल को पार कर जाता है।

यह दृष्टिकोण आंतरिक तर्क और उपकरण उपयोग के बीच संरचनात्मक असममिति को प्रभावी ढंग से हल करता है, जिससे अधिक कुशल और सटीक एजेंटिक रीजनिंग संभव होती है।