研究人员调查了仅回顾式微调(Retrospection-Only Fine-Tuning, ROFT),这是一种极简的在线过程,其中智能体生成对其自身经验的回顾性解释,并仅使用这些解释标记上的下一个标记预测损失进行微调。该方法不需要外部教师或基于奖励的策略更新。

在 Qwen3.5-4B 的软件工程实验中,经过 20 次更新后,ROFT 在 SWE-bench Verified 和 Pro 上分别达到了 49.2% 和 26.8% 的解决率,优于 GRPO 在 40 次更新后的结果。该方法还学会了解决所有基础模型尝试均失败的任务,并通过间接分配信用来鼓励良好的行为。

这些发现确立了自生成回顾作为有用的训练目标,表明学习解释可以提高学习执行的能力。