研究人员推出了 Eduardo,这是一种用于训练大语言模型导师的多轮强化学习方法,旨在解决“帮助困境”,即模型倾向于直接给出答案而非进行教学。该方法使用掩码近迁移后测和二元奖励门来抑制认知卸载并防止解决方案的直接移交。
- 该方法用两个二元奖励门替代了连续惩罚:导师回答的事实正确性以及无解决方案移交。
- 留一法消融实验证实,虽然仅靠学习增益奖励无法区分教学与告知,但奖励门减少了移交行为,且后测提升了域外迁移能力。
- Eduardo 训练了来自两种不同大语言模型架构的 4B、9B、14B 和 27B 模型。
- 经过后训练的 Eduardo-27B 模型在 MathTutorBench 上达到了 Gemini-3.1-Pro 的水平,在 TutorMoments 上达到了 Claude Opus 4.8 的水平,同时使用的思考 token 数量减少了 2.4-6.2 倍。
- 该模型在训练支持消退技术时,其使用“推动提供理由”这一教学动作的频率翻了一番以上。
研究团队开源了训练环境、一个包含 8,671 个问题的近迁移数据集以及经过训练的模型,以促进交互式辅导领域的进一步发展。