शोधकर्ताओं ने ज़ोन ऑफ़ प्रोक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (ZPPO) का परिचय दिया, एक विधि जो ज्ञान विलयन में भंगुरता और पुनर्बल सीखने में विचलन को दूर करने के लिए शिक्षक के ज्ञान को पॉलिसी ग्रेडिएंट के बजाय प्रॉम्प्ट में डालती है। ZPPO कठिन प्रश्नों के लिए बाइनरी उम्मीदवार-सहित प्रश्न (BCQ) और नकारात्मक उम्मीदवार-सहित प्रश्न (NCQ) बनाता है, और जब तक छात्र की सटीकता में सुधार नहीं होता या उन्हें निकाला नहीं जाता, तब तक उन्हें रीप्ले बफ़र के माध्यम से पुनः परिसंचारित करता है।
- ZPPO भेदभाव को मजबूर करने के लिए BCQs में एक सही शिक्षक प्रतिक्रिया को एक गलत छात्र प्रतिक्रिया के साथ जोड़ता है, जबकि NCQs छात्र की विफलताओं को समेटकर साझा त्रुटि मोड को उभारते हैं।
- इस विधि का परीक्षण 0.8B से 9B तक के स्केल पर 27B शिक्षक मॉडल का उपयोग करके Qwen3.5 परिवार पर किया गया था।
- मूल्यांकन में 16 VLM, 10 LLM और 5 वीडियो कार्यों सहित 31-बेंचमार्क समूह शामिल था।
- ZPPO ऑफ़/ऑन-पॉलिसी विलय और GRPO को हराता है, जिसमें सबसे बड़ी वृद्धि सबसे छोटे मॉडल स्केल पर देखी गई थी।
शिक्षक को पॉलिसी ग्रेडिएंट के बजाय प्रॉम्प्ट के अंदर रखकर, ZPPO ऑन-पॉलिसी धारणाओं को तोड़े बिना छात्र के वर्तमान निकटतम विकास क्षेत्र के भीतर सीखने को बढ़ावा देता है।