रिसर्चर्स ने मानक ऑन-पॉलिसी डिस्टिलेशन में प्रिफेक्स विफलता को दूर करने के लिए Relay On-Policy Distillation (Relay-OPD) पेश किया, जहाँ छात्र की त्रुटियाँ अविश्वसनीय निगरानी का कारण बनती हैं। इस विधि में शिक्षक-छात्र निरंतरता असममितता को ट्रिगर के रूप में उपयोग किया जाता है ताकि शिक्षक संक्षेप में नियंत्रण संभाल सके और छात्र फिर से शुरू होने से पहले ट्रेजेक्टरी को पुनर्निर्देशित कर सके।
- आठ गणितीय तर्क बेंचमार्क्स पर Qwen3-4B-Instruct-2507 शिक्षक और Qwen3-0.6B/1.7B-Non-Thinking छात्रों का उपयोग करता है।
- हर बेंचमार्क पर सर्वश्रेष्ठ या दूसरा सर्वश्रेष्ठ परिणाम प्राप्त करता है, 1.7B मॉडल के लिए औसतन मानक OPD से +5.73% और FastOPD से +1.49% अधिक प्रदर्शन करता है।
- 0.6B स्केल पर लगातार लाभ देखा जाता है, जबकि प्रशिक्षण ट्रेजेक्टरी की लंबाई को 50% से अधिक कम किया गया है।
यह दृष्टिकोण सीमित रिले बजट के माध्यम से महत्वपूर्ण शुरुआती स्थानों पर हस्तक्षेप को केंद्रित करता है, जिससे छात्र नीति से विचलन सीमित रहता है जबकि दक्षता और सटीकता में उल्लेखनीय सुधार होता है।