Los investigadores presentan Eduardo, una receta de aprendizaje por refuerzo multi-turno para entrenar tutores de modelos de lenguaje grandes que aborda el "dilema de la asistencia" donde los modelos tienden a dar respuestas en lugar de enseñar. El método utiliza un post-prueba de transferencia cercana enmascarada y compuertas de recompensa binarias para desalentar la descarga cognitiva y prevenir la entrega de soluciones.

  • El enfoque reemplaza las penalizaciones continuas con dos compuertas de recompensa binarias: corrección factual de la respuesta del tutor y sin entrega de solución.
  • Una ablación leave-one-out confirma que mientras las recompensas de ganancia de aprendizaje por sí solas no separan enseñar de contar, las compuertas reducen la entrega y el post-prueba mejora la transferencia fuera de dominio.
  • Eduardo entrena modelos de 4B, 9B, 14B y 27B de dos arquitecturas LLM distintas.
  • El modelo Eduardo-27B post-entrenado iguala a Gemini-3.1-Pro en MathTutorBench y Claude Opus 4.8 en TutorMoments usando 2.4-6.2x menos tokens de pensamiento.
  • El modelo más que duplica su uso del movimiento docente push-for-justification mientras entrena técnicas de desvanecimiento de soporte.

El equipo abre el entorno de entrenamiento, un conjunto de datos de transferencia cercana de 8,671 problemas y los modelos entrenados para facilitar el desarrollo adicional en tutoría interactiva.