يقدم الباحثون إدواردو، وهو وصفة للتكرار التعزيزي متعدد المراحل لتدريب مدرسي النماذج اللغوية الكبيرة تعالج "معضلة المساعدة" حيث تميل النماذج إلى إعطاء الإجابات بدلاً من التدريس. تستخدم الطريقة اختبارًا مقنعًا قريب النقل بعد الاختبار وبوابات مكافأة ثنائية لردع التحميل المعرفي ومنع تسليم الحلول.

  • تحل النهج محل العقوبات المستمرة ببوابتي مكافأة ثنائيتين: صحة الحقائق في استجابة المدرس وعدم تسليم الحل.
  • يؤكد حذف واحد تاركًا (leave-one-out) أنه بينما لا تفصل مكافآت كسب التعلم وحدها بين التدريس وإعطاء الإجابات، فإن البوابات تقلل من التسليم ويحسن الاختبار بعد التدريب النقل خارج المجال.
  • يدرب إدواردو نماذج بأحجام 4B و9B و14B و27B من بنيتين مختلفتين للنماذج اللغوية الكبيرة.
  • يتطابق نموذج إدواردو-27B المدرب بعد التدريب مع Gemini-3.1-Pro على MathTutorBench وClaude Opus 4.8 على TutorMoments باستخدام عدد رموز تفكير أقل بنسبة 2.4-6.2x.
  • يضاعف النموذج أكثر من ضعف استخدام حركة المعلم "الدفع نحو التبرير" أثناء تدريب تقنيات تلاشي الدعم.

يفتح الفريق بيئته التدريبية ومجموعة بيانات قريبة النقل مكونة من 8,671 مشكلة والنماذج المدربة لتسهيل التطوير الإضافي في التدريس التفاعلي.