Para peneliti memperkenalkan Distilasi Kekuatan On-Policy (OPPD), sebuah metode yang melatih model untuk menghasilkan jawaban berkualitas tinggi dalam satu langkah dengan meniru distribusi probabilitas yang dipertajam dari model guru. Pendekatan ini menghilangkan kebutuhan akan pengambilan sampel kandidat yang ekstensif selama inferensi sambil secara signifikan meningkatkan kinerja pada benchmark matematika dan pemrograman.

  • OPPD menggunakan sampler Monte Carlo sekuensial di mana distribusi kekuatan guru yang beku memberi bobot pada kandidat yang dihasilkan oleh model siswa untuk pembaruan kemungkinan maksimum.
  • Metode ini meningkatkan akurasi generasi tunggal hingga 23,0 poin pada MATH500 dan 27,3 poin pada GSM8K dibandingkan dengan baseline tanpa pelatihan pada suhu yang sama.
  • Satu generasi dari model terdistilasi mengungguli pengambilan sampel kekuatan dengan 64 kandidat, memulihkan 94 persen peningkatan yang disediakan oleh 16 kandidat pada model tanpa pelatihan.
  • OPPD mencetak skor lebih tinggi daripada GRPO yang dilatih dengan reward terverifikasi pada MATH500, GSM8K, dan AIME tanpa menggunakan jawaban referensi, dan dapat menambah hingga 9,3 poin ketika diterapkan setelah GRPO.
  • Teknik ini meningkatkan akurasi HumanEval hingga 5,3 poin dan mempertahankan peningkatan di berbagai keluarga model dan ukuran.

Metode ini memungkinkan model mencapai perbaikan penalaran yang biasanya memerlukan pengambilan sampel berat atau data referensi tambahan melalui pembaruan parameter langsung.