Pesquisadores investigam o Retrospection-Only Fine-Tuning (ROFT), um procedimento online mínimo onde um agente gera explicações retrospectivas de suas próprias experiências e é ajustado finamente usando apenas a perda de previsão do próximo token nesses tokens de explicação. Este método não requer professor externo ou atualização de política baseada em recompensa.

Em experimentos de engenharia de software com Qwen3.5-4B, o ROFT alcançou taxas de resolução de 49,2% e 26,8% no SWE-bench Verified e Pro após 20 atualizações, superando os resultados do GRPO após 40 atualizações. A abordagem também aprende a resolver tarefas onde todas as tentativas do modelo base falharam e incentiva boas ações atribuindo crédito indiretamente.

Esses achados estabelecem retrospectivas autogeradas como alvos de treinamento úteis, demonstrando que aprender a explicar pode melhorar o aprendizado para fazer.