Pesquisadores apresentam o TutorMoments, uma estrutura projetada para medir se grandes modelos de linguagem podem equilibrar a troca pedagógica entre fornecer suporte e incentivar o raciocínio independente. Construído com base em transcrições reais de tutoria matemática individual, o sistema reproduz pontos de decisão para avaliar o comportamento do modelo contra um ground truth anotado por humanos.

A avaliação utiliza 462 transcrições desidentificadas de estudantes dos EUA nos anos 2 a 7, anotadas por professores experientes que sinalizaram momentos que exigiam suporte ou rigor. Os modelos testados tendem a ajudar em excesso quando recebem um prompt simples, mas o desempenho melhora quando o prompt define explicitamente a troca entre ajudar e recuar. Apesar das melhorias, os LLMs ainda variam amplamente em confiabilidade e usam menos estratégias do que tutores humanos, frequentemente falhando em corresponder ao julgamento nuanceado de educadores experientes. A equipe disponibiliza o conjunto de dados, o código para o pipeline de reprodução e as reproduções dos modelos para ajudar pesquisadores a construir tutores de IA que se adaptem às necessidades dos alunos, em vez de fazerem o trabalho por eles.