研究者らは、大規模言語モデルが支援の提供と独立した推論の促進という教育的なトレードオフをバランスよく扱えるかどうかを測定するために設計されたフレームワークであるTutorMomentsを紹介した。実際の1対1の数学チューターングのトランスクリプトに基づいて構築されたこのシステムは、意思決定のポイントを書き戻し、モデルの振る舞いを人間が注釈をつけた正解と比較して評価する。

この評価では、2年生から7年生までの米国生徒による462件の個人情報を除去したトランスクリプトを使用し、支援や厳格さが必要な瞬間にフラグを立てた経験豊富な教師によって注釈が付けられた。テストされたモデルは、単純なプロンプトを与えられると過剰に支援しがちだが、プロンプトで支援と控えることのトレードオフを明示的に定義することでパフォーマンスが向上する。 改善が見られるものの、LLMはまだ信頼性に大きなばらつきがあり、人間チューターよりも少ない戦略しか使用せず、経験豊富な教育者の微妙な判断にしばしば追いつけていない。 研究チームは、AIチューターが生徒のニーズに合わせて適応し、代わりに作業を行わないように構築するのを支援するために、データセット、リプレイパイプラインのコード、およびモデルのリプレイを公開した。