Para peneliti memperkenalkan Relay On-Policy Distillation (Relay-OPD) untuk mengatasi kegagalan prefix dalam distilasi on-policy standar, di mana kesalahan siswa menyebabkan pengawasan yang tidak dapat diandalkan. Metode ini menggunakan asimetri kelanjutan guru-siswa sebagai pemicu bagi guru untuk sebentar mengambil alih dan mengarahkan ulang lintasan sebelum siswa melanjutkan.
- Memanfaatkan guru Qwen3-4B-Instruct-2507 dengan siswa Qwen3-0.6B/1.7B-Non-Thinking pada delapan benchmark penalaran matematika.
- Mencapai hasil terbaik atau kedua terbaik di setiap benchmark, mengungguli OPD standar sebesar +5,73% dan FastOPD sebesar +1,49% secara rata-rata untuk model 1.7B.
- Peningkatan konsisten diamati pada skala 0.6B, sementara panjang lintasan pelatihan berkurang lebih dari 50%.
Pendekatan ini memusatkan intervensi pada posisi awal kritis melalui anggaran relay terbatas, membatasi penyimpangan dari kebijakan siswa sambil secara signifikan meningkatkan efisiensi dan akurasi.