शोधकर्ताओं ने Masters प्रस्तावित किया, जो बड़े पैमाने पर विजन-लैंग्वेज मॉडल्स को एज डेप्लॉयमेंट के लिए उपयुक्त कॉम्पैक्ट संस्करणों में डिस्टिल करने के लिए एक मास्क-प्रोग्रेसिव रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है। विधि टीचर और स्टूडेंट मॉडल्स के बीच आकार अंतर से उत्पन्न अस्थिरता को संबोधित करती है।

  • Masters जटिलता कम करने के लिए टीचर के गैर-प्रभावी वजन को मास्क करता है, फिर प्रशिक्षण के दौरान क्षमता को क्रमिक रूप से पुनर्स्थापित करता है ताकि अधिक सहज सीखने की अनुमति मिल सके।
  • यह ऑफलाइन RL चरण को एकीकृत करता है जो मास्क्ड टीचर्स से पूर्व-जनरेट किए गए उत्तरों का उपयोग करता है, जिससे ऑनलाइन थिंक-एनसर पैराडाइम्स की कंप्यूटेशनल लागत से बचा जाता है।
  • फ्रेमवर्क दो पूरक पुरस्कारों का उपयोग करता है: उत्तर की सटीकता के लिए एक सटीकता पुरस्कार और स्थानांतरण की आसानी को मात्रात्मक रूप देने वाला एक डिस्टिलेशन पुरस्कार।

यह दृष्टिकोण स्टूडेंट्स को लंबे उत्तर जनरेशन प्रक्रियाओं की आवश्यकता के बिना समृद्ध लेकिन कुशल मार्गदर्शन का लाभ उठाकर मजबूत प्रदर्शन प्राप्त करने सक्षम बनाता है।