研究者らは、Retrospection-Only Fine-Tuning (ROFT) を調査している。これはエージェントが自身の経験の回顧的説明を生成し、その説明トークンにおける次のトークン予測損失のみを使用してファインチューニングされる最小限のオンライン手順である。この手法には外部教師や報酬ベースのポリシー更新は必要ない。

Qwen3.5-4B を用いたソフトウェアエンジニアリング実験では、ROFT は 20 回の更新後に SWE-bench Verified および Pro でそれぞれ 49.2% と 26.8% の解決率を達成し、40 回の更新後の GRPO の結果を上回った。このアプローチは、ベースモデルの試行がすべて失敗したタスクも解決することを学び、間接的にクレジットを割り当てることで良い行動を促進する。

これらの知見は、自己生成された回顧を有用な学習目標として確立し、説明することを学ぶことが実行することを学ぶことを改善できることを示している。