शोधकर्ताओं ने अनसुपervised ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (U-OPSD) का प्रस्ताव रखा है, एक विधि जो बाहरी निगरानी के बिवल मॉडल की अपनी जनरेशन का उपयोग करके बड़े भाषा मॉडलों के लिए पोस्ट-ट्रेनिंग सुधार प्राप्त करती है। यह दृष्टिकोण बहुमत वोट के माध्यम से एक pseudo-समाधान बनाने के लिए कई रोलआउट्स को सैंपल करता है, फिर शिक्षक वितरण को मॉडल की सबसे लंबी गलत पूर्णता के उपसर्गों में संक्षिप्त करता है।
- U-OPSD AIME24, MATH500, और AMC23 जैसे बेंचमार्क्स पर 4B और 8B स्केल पर Qwen3 नॉन-थिंकिंग मोड में बेस मॉडलों को क्रमशः 8.5% और 10.7% से सुधारता है।
- यह नॉन-थिंकिंग मोड में OPSD जैसे सुपervised तरीकों की तुलना में औसतन 3.2% और 2.3% अधिक प्रभावी है।
- थिंकिंग मोड में, U-OPSD OPSD और GRPO के बराबर या उससे बेहतर प्रदर्शन करता है, 8B स्केल पर अंतिम को 1.1% तक आगे बढ़ाता है।
यह विधि दिखाती है कि आंतरिक सुसंगतता के माध्यम से वास्तविक सेल्फ-डिस्टिलेशन संभव है, जो सुपervised ट्रेनिंग सिग्नल के लिए एक प्रतिस्पर्धी विकल्प प्रदान करता है।