Los investigadores presentan TutorMoments, un marco diseñado para medir si los modelos de lenguaje grandes pueden equilibrar la compensación pedagógica entre brindar apoyo y fomentar el razonamiento independiente. Basado en transcripciones reales de tutorías matemáticas uno a uno, el sistema reproduce los puntos de decisión para evaluar el comportamiento del modelo frente a una verdad fundamental anotada por humanos.

La evaluación utiliza 462 transcripciones desidentificadas de estudiantes estadounidenses en grados 2-7, anotadas por maestros experimentados que marcaron momentos que requerían andamiaje o rigor. Los modelos probados tienden a ayudar demasiado cuando se les da un prompt simple, pero el rendimiento mejora cuando el prompt define explícitamente la compensación entre ayudar y contenerse. Pese a las mejoras, los LLMs aún difieren ampliamente en confiabilidad y utilizan menos estrategias que los tutores humanos, a menudo fallando en igualar el juicio matizado de educadores experimentados. El equipo publica el conjunto de datos, el código para la tubería de reproducción y las reproducciones de modelos para ayudar a los investigadores a construir tutores de IA que se adapten a las necesidades del estudiante en lugar de hacer el trabajo por ellos.