研究人员推出了 TutorMoments,这是一个旨在衡量大型语言模型能否在提供支持与鼓励独立推理之间平衡教学权衡的框架。该系统基于真实的一对一数学辅导记录,重放决策点,以将模型行为与人工标注的真实情况进行对比评估。
该评估使用了来自美国 2-7 年级学生的 462 份去标识化辅导记录,由经验丰富的教师标注,标记出需要支架式辅助或严格训练的时刻。 测试中的模型在收到普通提示时往往过度提供帮助,但当提示明确定义帮助与克制之间的权衡时,表现会有所改善。 尽管有所改进,LLM 在可靠性方面仍存在较大差异,且使用的策略少于人类导师,常常无法匹配经验丰富的教育工作者的细致判断。 研究团队发布了数据集、回放管道的代码以及模型回放记录,以帮助研究人员构建能够适应学生需求而非代劳的 AI 导师。