शोधकर्ताओं ने एक नया सोच-जवाब डिस्टिलेशन फ्रेमवर्क प्रस्तावित किया है जो संपादित दृश्य-भाषा मॉडल की दृश्य साक्ष्य का उपयोग करने की क्षमता को महत्वपूर्ण तर्क-पूर्वअक्षरों को मास्क करके सुधारता है। यह दृष्टिकोण लंबे सोच-जवाब ट्रैकों में सामान्य "दृश्य भूल" समस्या को संबोधित करता है, जहां छात्र विस्तृत तर्क के दौरान दृश्य संकेतों पर ध्यान खो देते हैं।
विधि उच्च-प्रभाव वाले पाठ संकेतों का चयनात्मक रूप से अवरोध लगाने के लिए टोकन-वार महत्वपूर्ण तर्क-पूर्वअक्षर मास्किंग और डिस्टिलेशन कठिनाई के साथ स्केल होने वाली स्व-गति मास्क बजट शेड्यूलिंग रणनीति का उपयोग करती है। प्रशिक्षण के दौरान, ये मास्क मानक कारणता मास्क को प्रतिस्थापित करते हैं ताकि छात्र मॉडल अगले टोकन भविष्यवाणी के लिए दृश्य जानकारी पर अधिक निर्भर रहे।
प्रयोगात्मक परिणाम संकेत देते हैं कि यह दृष्टिकोण बहु-मोडल तर्क बेंचमार्क्स पर हाल के ओपन-सोर्स VLMs, VLM डिस्टिलेशन और स्व-डिस्टिलेशन विधियों से बेहतर है, जिसमें विश्लेषण ने सोचने की प्रक्रिया भर में बढ़ी हुई दृश्य उपयोग की पुष्टि की।