연구자들은 TutorMoments를 소개했습니다. 이는 대규모 언어 모델이 지원 제공과 독립적 추론 장려 사이의 교육적 균형을 맞출 수 있는지를 측정하기 위해 설계된 프레임워크입니다.
실제 1:1 수학 튜터링 기록을 기반으로 구축된 이 시스템은 결정 지점을 재생하여 모델의 행동을 인간이 주석으로 달린 정답과 비교 평가합니다.
평가에는 2~7학년 미국 학생들의 비식별화된 462건의 튜터링 기록이 사용되었으며, 숙련된 교사들이 지원이나 엄격함이 필요한 순간을 표시했습니다. 테스트된 모델들은 일반 프롬프트를 사용할 때 과도하게 도와주는 경향이 있지만, 프롬프트가 도와주고 물러서는 것 사이의 균형을 명시적으로 정의하면 성능이 향상됩니다. 개선에도 불구하고 LLM은 여전히 신뢰성에서 광범위한 차이를 보이며 인간 튜터보다 적은 전략을 사용하며, 종종 숙련된 교육자의 미묘한 판단과 일치하지 못합니다. 연구진은 학생들이 스스로 일할 수 있도록 하는 대신 학생의 필요에 적응하는 AI 튜터를 구축할 수 있도록 연구자들을 돕기 위해 데이터셋, 재생 파이프라인 코드 및 모델 재생을 공개했습니다.