연구자들은 Retrospection-Only Fine-Tuning (ROFT)를 조사하고 있습니다. 이는 에이전트가 자신의 경험에 대한 회고적 설명을 생성하고 해당 설명 토큰의 다음 토큰 예측 손실만을 사용하여 파인튜닝되는 최소한의 온라인 절차입니다. 이 방법에는 외부 교사나 보상 기반 정책 업데이트가 필요하지 않습니다.
Qwen3.5-4B를 사용한 소프트웨어 엔지니어링 실험에서 ROFT는 20회 업데이트 후 SWE-bench Verified 및 Pro에서 각각 49.2%와 26.8%의 해결률을 달성하여 40회 업데이트 후 GRPO의 결과를 능가했습니다. 이 접근 방식은 기본 모델의 모든 시도가 실패한 작업도 해결하는 방법을 배우고 간접적으로 크레딧을 할당하여 좋은 행동을 장려합니다.
이러한 발견은 자체 생성된 회고를 유용한 학습 목표로 확립하며, 설명하는 것을 배우는 것이 수행하는 것을 배우는 것을 개선할 수 있음을 보여줍니다.