Les chercheurs étudient le Retrospection-Only Fine-Tuning (ROFT), une procédure en ligne minimale où un agent génère des explications rétrospectives de ses propres expériences et est affiné en utilisant uniquement la perte de prédiction du prochain jeton sur ces jetons d'explication. Cette méthode ne nécessite ni enseignant externe ni mise à jour de politique basée sur la récompense.

Dans des expériences d'ingénierie logicielle avec Qwen3.5-4B, ROFT a atteint des taux de résolution de 49,2 % et 26,8 % sur SWE-bench Verified et Pro après 20 mises à jour, surpassant les résultats de GRPO après 40 mises à jour. L'approche apprend également à résoudre des tâches où toutes les tentatives du modèle de base ont échoué et encourage les bonnes actions en attribuant indirectement le crédit.

Ces résultats établissent les rétrospectives auto-générées comme des cibles d'entraînement utiles, démontrant qu'apprendre à expliquer peut améliorer l'apprentissage pour faire.