Исследователи представляют TutorMoments — фреймворк, предназначенный для измерения способности больших языковых моделей балансировать между педагогическим компромиссом предоставления поддержки и поощрения независимого мышления. Система, построенная на реальных стенограммах индивидуальных математических занятий с учениками, воспроизводит моменты принятия решений для оценки поведения модели по сравнению с аннотированными экспертами эталонными данными.
Оценка использует 462 обезличенных стенограммы учащихся из США в возрасте от 2 до 7 классов, аннотированные опытными учителями, которые отмечали моменты, требующие поддержки или строгого подхода. Тестируемые модели склонны чрезмерно помогать при получении обычного запроса, но их производительность улучшается, когда запрос явно определяет компромисс между помощью и воздержанием. Несмотря на улучшения, LLM все еще сильно различаются по надежности и используют меньше стратегий, чем человеческие репетиторы, часто не справляясь с тонким суждением опытных педагогов. Команда публикует набор данных, код для конвейера воспроизведения и записи поведения моделей, чтобы помочь исследователям создавать ИИ-репетиторов, адаптирующихся к потребностям студентов, а не выполняющих работу за них.