Les chercheurs présentent TutorMoments, un cadre conçu pour mesurer si les grands modèles de langage peuvent équilibrer le compromis pédagogique entre fournir un soutien et encourager la réflexion autonome. Basé sur des transcriptions réelles de tutorats individuels en mathématiques, le système rejoue les points de décision pour évaluer le comportement du modèle par rapport à une vérité terrain annotée par des humains.

L'évaluation utilise 462 transcriptions anonymisées d'élèves américains des niveaux 2 à 7, annotées par des enseignants expérimentés qui ont signalé les moments nécessitant un étayage ou de la rigueur. Les modèles testés ont tendance à trop aider lorsqu'ils reçoivent une invite simple, mais leurs performances s'améliorent lorsque l'invite définit explicitement le compromis entre aider et se retenir. Malgré ces améliorations, les LLMs varient considérablement en fiabilité et utilisent moins de stratégies que les tuteurs humains, échouant souvent à égaler le jugement nuancé des éducateurs expérimentés. L'équipe publie le jeu de données, le code du pipeline de rejeu et les rejeux de modèles pour aider les chercheurs à construire des tuteurs IA qui s'adaptent aux besoins des élèves plutôt que de faire le travail à leur place.