शोधकर्ताओं ने ऑन-पॉलिसी पावर डिस्टिलेशन (OPPD) पेश किया, एक विधि जो भाषा मॉडल को शिक्षक मॉडल की तीव्र प्रायिकता वितरण का अनुकरण करके एक ही पास में उच्च गुणवत्ता वाले उत्तर उत्पन्न करने के लिए प्रशिक्षित करती है। यह दृष्टिकोण निष्पासन के दौरान व्यापक उम्मीदवारों के नमूनाकरण की आवश्यकता को समाप्त करता है जबकि तर्क कार्यों पर प्रदर्शन में महत्वपूर्ण वृद्धि करता है।

  • OPPD एक क्रमागत मांटे कार्लो सैम्पलर का उपयोग करता है जहां एक फ्रोजन शिक्षक की पावर डिस्ट्रिब्यूशन मॉडल द्वारा उत्पन्न उम्मीदवारों को वजन देती है जिसे प्रशिक्षित किया जा रहा है।
  • इस विधि ने समान तापमान पर अप्रशिक्षित मॉडल की तुलना में MATH500 पर 23.0 बिंदु तक और GSM8K पर 27.3 बिंदु तक एकल-जनरेशन सटीकता बढ़ाई।
  • डिस्टिल्ड मॉडल से एकल जनरेशन प्रकाशित पावर सैम्पलिंग को 64 उम्मीदवारों के साथ हराता है, और अप्रशिक्षित मॉडल में 16 उम्मीदवारों द्वारा प्रदान की गई लाभ का 94 प्रतिशत पुनर्स्थापित करता है।
  • OPPD बिना किसी संदर्भ उत्तर के MATH500, GSM8K और AIME पर GRPO से अधिक स्कोर प्राप्त करता है, और GRPO के बाद लागू करने पर 9.3 बिंदु तक जोड़ सकता है।
  • इस तकनीक ने HumanEval सटीकता को 5.3 बिंदु तक बढ़ाया है और यह विभिन्न मॉडल परिवारों और आकारों में काम करती है।

OPPD मॉडल की वास्तुकला को बदले बिना या खोज-आधारित निष्पासन की आवश्यकता के बिना तर्क क्षमताओं को बेहतर बनाने का एक पैरामीटर-कुशल तरीका प्रदान करता है।