Исследователи представляют Eduardo, рецепт многошагового обучения с подкреплением для обучения тьюторов на основе больших языковых моделей, который решает «дилемму помощи», при которой модели склонны давать ответы, а не обучать. Метод использует тестирование после маскировки с близким переносом и бинарные вентили вознаграждения, чтобы предотвратить когнитивную разгрузку и передачу решений.

  • Подход заменяет непрерывные штрафы двумя бинарными вентилями вознаграждения: фактической правильностью ответа тьютора и отсутствием передачи решения.
  • Абляция с оставлением одного подтверждает, что хотя награды за прирост знаний сами по себе не разделяют преподавание и рассказывание, вентили уменьшают передачу, а тестирование после маскировки улучшает перенос вне домена.
  • Eduardo обучает модели 4B, 9B, 14B и 27B из двух различных архитектур LLM.
  • Постобученная модель Eduardo-27B достигает уровня Gemini-3.1-Pro на MathTutorBench и Claude Opus 4.8 на TutorMoments, используя в 2,4–6,2 раза меньше токенов размышления.
  • Модель более чем вдвое увеличивает использование приема учителя «настаивание на обосновании» во время обучения техникам постепенного отказа от поддержки.

Команда открывает исходный код обучающей среды, набор данных из 8671 задачи с близким переносом и обученные модели для содействия дальнейшему развитию интерактивного тьюторства.