Peneliti memperkenalkan PLVR (Program Learning with Verifiable Rewards), sebuah metode pasca-pelatihan yang mempelajari program penalaran eksplisit yang terdiri dari primitif deterministik dan neural, alih-alih memperbarui bobot model. Pendekatan ini memanfaatkan backpropagasi simbolik, di mana penugasan kredit dilakukan melalui inferensi tipe pada tanda tangan primitif bukan estimasi.

  • Pada LiveCodeBench v6 dan Tau2Bench, model dasar 30B dengan PLVR mengungguli pembelajaran penguatan sebesar 27.8 poin rata-rata dengan anggaran yang setara.
  • Metode ini juga melampaui model frontier yang ukurannya satu orde magnitudo lebih besar sebesar 13.6 poin.
  • Sebuah pustaka primitif tunggal melayani kedua benchmark, hanya memerlukan 100 contoh untuk tugas baru tanpa data fine-tuning tambahan.
  • Eksperimen mengidentifikasi forward pass sebagai sumber keunggulan dibandingkan pengambilan sampel seragam.

Para penulis merilis pustaka backpropagasi simbolik dan pemeriksa kepatuhan untuk memungkinkan penerapan pada pustaka primitif lainnya.