Peneliti memperkenalkan Distilasi Kekuatan On-Policy (OPPD), sebuah metode yang melatih model bahasa untuk menghasilkan jawaban berkualitas tinggi dalam satu kali lemparan dengan meniru distribusi probabilitas yang dipertajam dari model guru. Pendekatan ini menghilangkan kebutuhan akan pengambilan sampel kandidat yang ekstensif selama inferensi sambil secara signifikan meningkatkan kinerja pada tugas penalaran.
- OPPD menggunakan sampler Monte Carlo sekuensial di mana distribusi kekuatan guru yang beku memberi bobot pada kandidat yang dihasilkan oleh model yang sedang dilatih.
- Metode ini meningkatkan akurasi generasi tunggal hingga 23,0 poin pada MATH500 dan 27,3 pada GSM8K dibandingkan dengan model yang belum dilatih pada suhu yang sama.
- Satu generasi dari model yang didistilasi mengungguli pengambilan sampel kekuatan yang diterbitkan dengan 64 kandidat, memulihkan 94 persen peningkatan yang diberikan oleh 16 kandidat dalam model yang belum dilatih.
- OPPD mencetak skor lebih tinggi daripada GRPO pada MATH500, GSM8K, dan AIME tanpa menggunakan jawaban referensi, dan dapat menambahkan hingga 9,3 poin ketika diterapkan setelah GRPO.
- Teknik ini juga meningkatkan akurasi HumanEval hingga 5,3 poin dan berfungsi di berbagai keluarga model dan ukuran.
OPPD menyediakan cara yang efisien dalam hal parameter untuk meningkatkan kemampuan penalaran tanpa mengubah arsitektur model atau memerlukan inferensi berbasis pencarian.