يقدم الباحثون تقريبًا غير رسمي متتابع (Relay-OPD) لمعالجة فشل البادئة في التقريب غير الرسمي القياسي، حيث تؤدي أخطاء الطالب إلى إشراف غير موثوق. تستخدم الطريقة عدم تماثل الاستمرارية بين المعلم والطالب كمحفز ليأخذ المعلم زمام المبادرة لفترة قصيرة لإعادة توجيه المسار قبل أن يستأنف الطالب.
- يستخدم معلم Qwen3-4B-Instruct-2507 مع طلاب Qwen3-0.6B/1.7B-Non-Thinking على ثمانية معايير للاستدلال الرياضي.
- حقق أفضل النتائج أو الثانية الأفضل في كل معيار، متفوقًا على OPD القياسي بنسبة +5.73٪ وFastOPD بنسبة +1.49٪ في المتوسط للنموذج 1.7B.
- لوحظت مكاسب متسقة عند مقياس 0.6B، بينما تم تقليل طول مسار التدريب بأكثر من 50٪.
يركز هذا النهج التدخل على المواقف الحرجة المبكرة عبر ميزانية نقل محدودة، مما يحد من الانحراف عن سياسة الطالب مع تحسين الكفاءة والدقة بشكل كبير.