연구진은 "보조 딜레마"를 해결하는 대규모 언어 모델(Large Language Model) 튜터를 훈련하기 위한 다중 턴 강화 학습(Reinforcement Learning) 방법론인 에두아르도(Eduardo)를 소개합니다. 이 딜레마에서는 모델이 가르치는 대신 정답을 제공하는 경향이 있습니다. 이 방법은 마스킹된 근접 전이 사후 테스트와 이진 보상 게이트(binary reward gates)를 사용하여 인지적 외부 처리(cognitive offloading)를 억제하고 솔루션 전달(solution handover)을 방지합니다.
- 접근 방식은 연속적인 패널티 대신 두 가지 이진 보상 게이트로 대체합니다: 튜터 응답의 사실적 정확성과 솔루션 전달 없음.
- 하나씩 제거하는(ablation) 실험은 학습 향상 보상만으로는 가르침과 말하기를 구분하지 못하지만, 게이트가 전달을 줄이고 사후 테스트가 도메인 외부 전이를 개선함을 확인합니다.
- 에두아르도는 두 가지 서로 다른 LLM 아키텍처에서 4B, 9B, 14B 및 27B 모델을 훈련합니다.
사후 훈련된 에두아르도-27B 모델은 Gemini-3.1-Pro와 MathTutorBench에서 동급이며, Claude Opus 4.8과 TutorMoments에서 동기화되지만 사고 토큰(thinking tokens)을 2.4-6.2배 적게 사용합니다.
모델은 지원 소멸(support fading) 기법을 훈련하면서 정당화 요청(push-for-justification) 교사 행동을 사용하는 빈도를 두 배 이상 증가시킵니다.
연구진은 상호작용식 튜터링 분야의 추가 발전을 촉진하기 위해 훈련 환경, 8,671문제 근접 전이 데이터셋 및 훈련된 모델을 오픈소스로 공개합니다.