Исследователи изучают Retrospection-Only Fine-Tuning (ROFT), минимальную онлайн-процедуру, при которой агент генерирует ретроспективные объяснения собственного опыта и дообучается с использованием только функции потерь предсказания следующего токена на этих токенах объяснений. Этот метод не требует внешнего учителя или обновления политики на основе вознаграждения.
В экспериментах по программной инженерии с Qwen3.5-4B ROFT достиг показателей 49,2% и 26,8% успешных решений на SWE-bench Verified и Pro после 20 обновлений, превзойдя результаты GRPO после 40 обновлений. Подход также учит решать задачи, где все попытки базовой модели были неудачными, и поощряет правильные действия за счёт косвенного распределения заслуг.
Эти результаты показывают, что самостоятельно сгенерированные ретроспекции являются полезными целевыми данными для обучения, демонстрируя, что обучение объяснению может улучшить обучение выполнению задач.