शोधकर्ता रेट्रोस्पेक्शन-ओनली फाइन-ट्यूनिंग (ROFT) की जांच कर रहे हैं, जो एक न्यूनतम ऑनलाइन प्रक्रिया है जहाँ एक एजेंट अपने अनुभवों की पश्चातवृत्ति व्याख्याएँ उत्पन्न करता है और केवल उन व्याख्या टोकनों पर अगले-टोकन पूर्वानुमान हानि का उपयोग करके फाइन-ट्यून किया जाता है। इस विधि को किसी बाहरी शिक्षक या पुरस्कार-आधारित नीति अपडेट की आवश्यकता नहीं है।

Qwen3.5-4B के साथ सॉफ्टवेयर-इंजीनियरिंग प्रयोगों में, ROFT ने 20 अपडेट के बाद SWE-bench Verified और Pro पर 49.2% और 26.8% हल दरें प्राप्त कीं, जो 40 अपडेट के बाद GRPO के परिणामों से बेहतर हैं। यह दृष्टिकोण उन कार्यों को हल करना भी सीखता है जहाँ सभी आधार-मॉडल प्रयास विफल रहे थे और क्रैडिट को परोक्ष रूप से सौंपकर अच्छे कार्यों को प्रोत्साहित करता है।

इन निष्कर्षों ने स्व-उत्पन्न पश्चातवृत्तियों को उपयोगी प्रशिक्षण लक्ष्य के रूप में स्थापित किया है, यह प्रदर्शित करते हुए कि समझना सीखने से करना सीखना बेहतर हो सकता है।