Para peneliti memperkenalkan Zone of Proximal Policy Optimization (ZPPO), sebuah metode yang menyuntikkan pengetahuan guru ke dalam prompt daripada gradien kebijakan untuk mengatasi kerapuhan dalam distilasi pengetahuan dan pergeseran dalam pembelajaran penguatan. ZPPO membangun Binary Candidate-included Questions (BCQ) dan Negative Candidate-included Questions (NCQ) untuk pertanyaan sulit, dan memutar ulang pertanyaan tersebut melalui buffer replays hingga akurasi siswa meningkat atau pertanyaan tersebut dihapus.
- ZPPO memasangkan satu respons guru yang benar dengan satu respons siswa yang salah dalam BCQ untuk memaksa diskriminasi, sementara NCQ mengagregalkan kegagalan siswa untuk menyoroti mode kesalahan bersama.
- Metode ini diuji pada keluarga Qwen3.5 pada skala dari 0,8B hingga 9B menggunakan model guru 27B.
- Evaluasi mencakup rangkaian 31 benchmark termasuk 16 VLM, 10 LLM, dan 5 tugas Video.
- ZPPO mengungguli distilasi off/on-policy dan GRPO, dengan peningkatan terbesar diamati pada skala model terkecil.
Dengan menjaga guru tetap berada di dalam prompt daripada gradien kebijakan, ZPPO menghindari pelanggaran asumsi on-policy sambil memperkuat pembelajaran di dalam zona perkembangan proksimal saat ini siswa.