शोधकर्ताओं ने TutorMoments पेश किया, एक फ्रेमवर्क जो इस मापने के लिए डिज़ाइन किया गया है कि क्या बड़े भाषा मॉडल सहायता प्रदान करने और स्वतंत्र तर्क को बढ़ावा देने के बीच शैक्षिक व्यापार-समझौते को संतुलित कर सकते हैं। वास्तविक एक-से-एक गणित ट्यूटिंग ट्रांसक्रिप्ट पर निर्मित, सिस्टम मॉडल व्यवहार का आकलन करने के लिए निर्णय बिंदुओं को पुनः चलाता है और मानव-अनुसूचित भूमि सत्य के खिलाफ।
आकलन में ग्रेड 2-7 के अमेरिकी छात्रों से 462 डिजिटल ट्रांसक्रिप्ट का उपयोग किया गया, जिन्हें अनुभवी शिक्षकों द्वारा अनोखा बनाया गया था जो सहायता या कठोरता की आवश्यकता वाले क्षणों को चिह्नित करते थे। आज़माए गए मॉडल सामान्य प्रॉम्प्ट दिए जाने पर अधिक मदद करने की प्रवृत्ति रखते हैं, लेकिन जब प्रॉम्प्ट स्पष्ट रूप से मदद और रुकने के बीच व्यापार-समझौते को परिभाषित करता है तो प्रदर्शन में सुधार होता है। सुधारों के बावजूद, LLMs अभी भी विश्वसनीयता में व्यापक रूप से भिन्न होते हैं और मानव ट्यूटरों की तुलना में कम रणनीतियों का उपयोग करते हैं, अक्सर अनुभवी शिक्षकों की सूक्ष्म निर्णय क्षमता को मेल नहीं खा पाते। टीम ने शोधकर्ताओं को छात्रों की आवश्यकताओं के अनुसार अनुकूलित AI ट्यूटर बनाने में मदद करने के लिए डेटासेट, पुनः चलाए जाने वाले पाइपलाइन का कोड और मॉडल पुनः चलाए गए प्रकाशित किए हैं।