Para peneliti memperkenalkan Eduardo, sebuah resep pembelajaran penguatan multi-gilir untuk melatih tutor model bahasa besar yang mengatasi "dilema bantuan" di mana model cenderung memberikan jawaban daripada mengajar. Metode ini menggunakan post-test transfer-dekat tersembunyi dan gerbang hadiah biner untuk mencegah offloading kognitif dan menghindari penyerahan solusi.
- Pendekatan ini mengganti penalti kontinu dengan dua gerbang hadiah biner: kebenaran faktual respons tutor dan tidak ada penyerahan solusi.
- Ablasi leave-one-out mengonfirmasi bahwa meskipun hanya hadiah peningkatan pembelajaran yang tidak memisahkan mengajar dari memberi tahu, gerbang mengurangi penyerahan dan post-test meningkatkan transfer di luar domain.
- Eduardo melatih model 4B, 9B, 14B, dan 27B dari dua arsitektur LLM yang berbeda.
- Model Eduardo-27B pasca-pelatihan setara dengan Gemini-3.1-Pro pada MathTutorBench dan Claude Opus 4.8 pada TutorMoments menggunakan 2,4-6,2x lebih sedikit token pemikiran.
- Model ini lebih dari menggandakan penggunaan gerakan guru push-for-justification sambil melatih teknik fading dukungan.
Tim tersebut membuka sumber lingkungan pelatihan, dataset transfer-dekat 8.671 masalah, dan model yang dilatih untuk memfasilitasi pengembangan lebih lanjut dalam tutoring interaktif.