يبحث الباحثون في ضبط الفروق الوحيد للاسترجاع (Retrospection-Only Fine-Tuning) (ROFT)، وهي إجراء عبر الإنترنت بسيط حيث يولد وكيل شروحات استرجاعية لتجاربه الخاصة ويتم ضبطه بدقة باستخدام خسارة التنبؤ بالرمز التالي فقط على رموز الشرح هذه. لا يتطلب هذا الأسلوب معلماً خارجياً أو تحديثاً للسياسة القائم على المكافأة.

في تجارب هندسة البرمجيات مع Qwen3.5-4B، حقق ROFT معدلات حل بنسبة 49.2% و26.8% على SWE-bench Verified وPro بعد 20 تحديثاً، متفوقاً على نتائج GRPO بعد 40 تحديثاً. يتعلم النهج أيضاً حل المهام التي فشلت فيها جميع محاولات النموذج الأساسي ويشجع الإجراءات الجيدة من خلال تعيين الائتمان بشكل غير مباشر.

تؤسس هذه النتائج الاسترجاعات المولَّدة ذاتياً كأهداف تدريب مفيدة، مما يوضح أن تعلم الشرح يمكن أن يحسّن التعلم للقيام.