Para peneliti mengusulkan Distilasi Diri On-Policy Tanpa Pengawasan (U-OPSD), sebuah metode yang mencapai peningkatan pasca-pelatihan untuk model bahasa besar hanya menggunakan generasi model itu sendiri tanpa supervisi eksternal. Pendekatan ini mengambil beberapa rollouts untuk membangun solusi pseudo melalui pemungutan suara mayoritas, lalu mendistilasi distribusi guru ke dalam awalan dari penyelesaian salah terpanjang model.
- U-OPSD meningkatkan model dasar sebesar 8,5% dan 10,7% pada mode non-pemikiran Qwen3 di skala 4B dan 8B melintasi benchmark seperti AIME24, MATH500, dan AMC23.
- Metode ini mengungguli metode terawasi seperti OPSD dengan rata-rata 3,2% dan 2,3% dalam mode non-pemikiran.
- Dalam mode pemikiran, U-OPSD menyamai atau melampaui OPSD dan GRPO, mengungguli yang terakhir hingga 1,1% pada skala 8B.
Metode ini menunjukkan bahwa distilasi diri sejati dimungkinkan melalui konsistensi internal, menawarkan alternatif kompetitif terhadap sinyal pelatihan terawasi.