يقدم الباحثون إطار عمل TutorMoments، المصمم لقياس قدرة نماذج اللغة الكبيرة على موازنة المقايضة التربوية بين تقديم الدعم وتشجيع التفكير المستقل. مبنية على نصوص حقيقية لتدريس الرياضونة فردياً، يعيد النظام تشغيل نقاط القرار لتقييم سلوك النموذج مقابل الحقيقة الأساسية التي وضعها البشر.

تستخدم التقييم 462 نصاً مجهول الهوية من طلاب أمريكيين في الصفوف 2-7، قام بوضع العلامات عليها معلمون ذوو خبرة حددوا اللحظات التي تتطلب دعمًا أو دقة. تميل النماذج المختبرة إلى الإفراط في المساعدة عند إعطائها موجهًا بسيطًا، لكن الأداء يتحسن عندما يحدد الموجه بشكل صريح المقايضة بين المساعدة والامتناع. على الرغم من التحسينات، لا تزال نماذج اللغة الكبيرة تختلف بشكل كبير في الموثوقية وتستخدم استراتيجيات أقل من المعلمين البشريين، وغالباً ما تفشل في مطابقة الحكم الدقيق للمعلمين ذوي الخبرة. أطلق الفريق مجموعة البيانات، وكود خط الأنابيب لإعادة التشغيل، وإعادة تشغيل النماذج لمساعدة الباحثين على بناء معلمين آليين يتكيفون مع احتياجات الطلاب بدلاً من القيام بالعمل نيابة عنهم.