Pesquisadores apresentam o Eduardo, uma receita de aprendizado por reforço multi-turn para treinar tutores de modelos de linguagem grandes que aborda o "dilema da assistência", onde os modelos tendem a dar respostas em vez de ensinar. O método utiliza um pós-teste de transferência próxima mascarado e gates de recompensa binários para desencorajar o descarregamento cognitivo e evitar a entrega da solução.

  • A abordagem substitui penalidades contínuas por dois gates de recompensa binários: correção factual da resposta do tutor e ausência de entrega da solução.
  • Uma ablação leave-one-out confirma que, embora as recompensas de ganho de aprendizado sozinhas não separem o ensino da simples transmissão, os gates reduzem a entrega e o pós-teste melhora a transferência fora do domínio.
  • O Eduardo treina modelos de 4B, 9B, 14B e 27B de duas arquiteturas LLM distintas.
  • O modelo Eduardo-27B pós-treinamento iguala o Gemini-3.1-Pro no MathTutorBench e o Claude Opus 4.8 no TutorMoments, usando 2,4 a 6,2 vezes menos tokens de raciocínio.
  • O modelo mais que dobra seu uso da técnica de ensino "push-for-justification" enquanto treina técnicas de desvanecimento do suporte.

A equipe disponibiliza em código aberto o ambiente de treinamento, um conjunto de dados de transferência próxima com 8.671 problemas e os modelos treinados para facilitar o desenvolvimento contínuo no tutoramento interativo.