研究者らは、モデルが答えを与えるのではなく教えることを重視する「アシスタンスジレンマ」に対処するため、大規模言語モデルのチューターを訓練するためのマルチターン強化学習手法であるEduardoを紹介した。この手法は、認知オフローディングを抑制し、解答の丸投げを防ぐために、マスク付きニア転移型事後テストとバイナリ報酬ゲートを使用する。
- 連続的なペナルティに代わり、チューターの回答の事実的正しさと解答の丸げがないことの2つのバイナリ報酬ゲートが採用されている。
- leave-one-outアブレーションにより、学習向上報酬だけでは指導と説明を区別できないことが確認されたが、ゲートによって丸げが減少し、事後テストによってドメイン外転移が改善した。
Eduardoは2つの異なるLLMアーキテクチャから4B、9B、14B、27Bのモデルを訓練する。
- 後期訓練されたEduardo-27Bモデルは、MathTutorBenchでGemini-3.1-Proと同等のパフォーマンスを示し、TutorMomentsではClaude Opus 4.8と同等でありながら、思考トークンを2.4〜6.2倍少なく使用している。
- 支援フェーディング技法の訓練中に、正当性を求める教師の動きの使用が2倍以上に増加した。
チームは、インタラクティブなチューティングにおけるさらなる開発を促進するため、訓練環境、8,671件の問題からなるニア転移型データセット、および訓練済みモデルをオープンソースとして公開する。