Makalah ini memperkenalkan CANOPY (Coverage-ANchored On-PolicY RL), sebuah protokol yang mengatasi kelaparan sinyal dan pergeseran kebijakan dalam pembelajaran penguatan jangka panjang untuk model terbuka berukuran kecil. Dengan melakukan skalasi eksplorasi pada tugas yang sama dan menjaga pembaruan tetap terikat KL, metode ini memungkinkan agen belajar secara efektif hanya dari verifikasi di akhir tugas.

  • CANOPY melakukan skalasi eksplorasi hingga sinyal alami muncul kembali, menghindari keheningan akibat reward yang jarang pada tugas sulit.
  • Pembaruan dijaga tetap on-policy dan dibatasi pada token tindakan agen sendiri untuk mencegah pergeseran kebijakan.
  • Kebijakan Qwen3-14B yang dilatih dengan CANOPY meraih puncak papan peringkat publik AppWorld (Feb. 2026) dengan TGC Test-Normal sebesar 86,9.
  • Prinsip yang sama meningkatkan skor Qwen3.5-9B pada SWE-bench Verified sebanyak 16,6 poin tanpa sinyal kredit tambahan atau perancah rumit.

Para penulis berargumen bahwa RL agentic saja dapat menginternalisasi kemampuan jangka panjang secara langsung ke dalam model terbuka berukuran kecil, dengan tumpukan pelatihan lengkap yang direncanakan untuk dirilis.