Peneliti menyelidiki Retrospection-Only Fine-Tuning (ROFT), sebuah prosedur online minimal di mana agen menghasilkan penjelasan retrospektif dari pengalamannya sendiri dan dilakukan fine-tuning menggunakan hanya kerugian prediksi token berikutnya pada token penjelasan tersebut. Metode ini tidak memerlukan guru eksternal atau pembaruan kebijakan berbasis imbalan.

Dalam eksperusi rekayasa perangkat lunak dengan Qwen3.5-4B, ROFT mencapai tingkat penyelesaian 49,2% dan 26,8% pada SWE-bench Verified dan Pro setelah 20 pembaruan, mengungguli hasil GRPO setelah 40 pembaruan. Pendekatan ini juga belajar menyelesaikan tugas-tugas di mana semua upaya model dasar gagal dan mendorong tindakan baik dengan memberikan kredit secara tidak langsung.

Temuan ini menetapkan retrospeksi yang dihasilkan sendiri sebagai target pelatihan yang berguna, menunjukkan bahwa belajar menjelaskan dapat meningkatkan pembelajaran untuk melakukan.