शोधकर्ताओं ने ऑन-पोलिसी पावर डिस्टिलेशन (OPPD) पेश किया, एक विधि जो शिक्षक मॉडल की तीक्ष्ण प्रायिकता वितरण का अनुकरण करके मॉडल को एक ही पास में उच्च गुणवत्ता वाले उत्तर जनरेट करने के लिए प्रशिक्षित करती है। यह दृष्टिकोण इनफरेंस के दौरान व्यापक उम्मीदवार सैंपलिंग की आवश्यकता को समाप्त करता है जबकि गणितीय और कोडिंग बेंचमार्क्स पर प्रदर्शन में महत्वपूर्ण वृद्धि करता है।
- OPPD एक क्रमागत मोंटे कार्लो सैम्पलर का उपयोग करता है जहां एक फ्रोजन शिक्षक की पावर डिस्ट्रिब्यूशन छात्र मॉडल द्वारा जनरेट किए गए उम्मीदवारों को अधिकतम-संभावना अपडेट के लिए वजन देती है।
- इस विधि से एकल-जनरेशन सटीकता में MATH500 पर 23.0 बिंदु और GSM8K पर 27.3 बिंदु तक की वृद्धि होती है, समान तापमान पर अप्रशिक्षित बेलाइन की तुलना में।
- डिस्टिल्ड मॉडल से एकल जनरेशन 64 उम्मीदवारों के साथ पावर सैंपलिंग से बेहतर प्रदर्शन करता है, और अप्रशिक्षित मॉडल में 16 उम्मीदवारों द्वारा प्रदान की गई लाभ का 94 प्रतिशत पुनर्स्थापित करता है।
- OPPD MATH500, GSM8K, और AIME पर सत्यापित इनामों के साथ प्रशिक्षित GRPO से उच्च स्कोर प्राप्त करता है बिना किसी संदर्भ उत्तर का उपयोग किए, और GRPO के बाद लागू करने पर 9.3 बिंदु तक जोड़ सकता है।
- इस तकनीक से HumanEval सटीकता में 5.3 बिंदु तक की वृद्धि होती है और यह विभिन्न मॉडल परिवारों और आकारों के पार लाभ बनाए रखती है।
यह विधि मॉडलों को भारी सैंपलिंग या अतिरिक्त संदर्भ डेटा की आवश्यकता वाले तर्क में सुधार प्राप्त करने देती है, सीधे पैरामीटर अपडेट के माध्यम से।