Para peneliti memperkenalkan Eduardo, sebuah resep pembelajaran penguatan multi-gilir untuk melatih tutor model bahasa besar yang mengatasi "dilema bantuan" di mana model cenderung memberikan jawaban daripada mengajar. Metode ini menggunakan post-test transfer-dekat tersembunyi dan gerbang hadiah biner untuk mencegah offloading kognitif dan menghindari penyerahan solusi.

  • Pendekatan ini mengganti penalti kontinu dengan dua gerbang hadiah biner: kebenaran faktual respons tutor dan tidak ada penyerahan solusi.
  • Ablasi leave-one-out mengonfirmasi bahwa meskipun hanya hadiah peningkatan pembelajaran yang tidak memisahkan mengajar dari memberi tahu, gerbang mengurangi penyerahan dan post-test meningkatkan transfer di luar domain.
  • Eduardo melatih model 4B, 9B, 14B, dan 27B dari dua arsitektur LLM yang berbeda.
  • Model Eduardo-27B pasca-pelatihan setara dengan Gemini-3.1-Pro pada MathTutorBench dan Claude Opus 4.8 pada TutorMoments menggunakan 2,4-6,2x lebih sedikit token pemikiran.
  • Model ini lebih dari menggandakan penggunaan gerakan guru push-for-justification sambil melatih teknik fading dukungan.

Tim tersebut membuka sumber lingkungan pelatihan, dataset transfer-dekat 8.671 masalah, dan model yang dilatih untuk memfasilitasi pengembangan lebih lanjut dalam tutoring interaktif.