Les chercheurs présentent Eduardo, une méthode d'apprentissage par renforcement multi-tours pour entraîner des tuteurs basés sur de grands modèles de langage (LLM), qui répond au « dilemme de l'assistance » où les modèles ont tendance à donner des réponses plutôt qu'à enseigner. La méthode utilise un post-test de transfert proche masqué et des portes de récompense binaires pour décourager le transfert cognitif et empêcher la remise directe des solutions.
- L'approche remplace les pénalités continues par deux portes de récompense binaires : l'exactitude factuelle de la réponse du tuteur et l'absence de remise de la solution.
- Une ablation leave-one-out confirme que si les récompenses basées sur le gain d'apprentissage ne séparent pas à elles seules l'enseignement de la simple transmission, les portes réduisent la remise de solutions et le post-test améliore le transfert hors domaine.
- Eduardo entraîne des modèles de 4B, 9B, 14B et 27B issus de deux architectures LLM distinctes.
- Le modèle Eduardo-27B post-entraîné égale Gemini-3.1-Pro sur MathTutorBench et Claude Opus 4.8 sur TutorMoments en utilisant 2,4 à 6,2 fois moins de tokens de réflexion.
- Le modèle plus que double son utilisation du mouvement pédagogique « pousser à justifier » tout en s'entraînant aux techniques d'atténuation progressive du support.
L'équipe open-source l'environnement d'entraînement, un jeu de données de transfert proche de 8 671 problèmes et les modèles entraînés afin de faciliter le développement ultérieur dans le tutorat interactif.