Los investigadores investigan el Retrospection-Only Fine-Tuning (ROFT), un procedimiento en línea mínimo donde un agente genera explicaciones retrospectivas de sus propias experiencias y se ajusta finamente utilizando únicamente la pérdida de predicción del siguiente token en esos tokens de explicación. Este método no requiere un maestro externo ni una actualización de política basada en recompensas.
En experimentos de ingeniería de software con Qwen3.5-4B, ROFT alcanzó tasas de resolución del 49,2 % y 26,8 % en SWE-bench Verified y Pro después de 20 actualizaciones, superando los resultados de GRPO después de 40 actualizaciones. El enfoque también aprende a resolver tareas donde todos los intentos del modelo base fallaron y fomenta buenas acciones asignando crédito indirectamente.
Estos hallazgos establecen las retrospectivas autogeneradas como objetivos de entrenamiento útiles, demostrando que aprender a explicar puede mejorar el aprendizaje para hacer.