Les chercheurs introduisent la Distillation On-Policy par Relais (Relay-OPD) pour pallier l'échec du préfixe dans la distillation on-policy standard, où les erreurs de l'élève entraînent une supervision peu fiable. La méthode utilise une asymétrie de continuation professeur-élève comme déclencheur permettant au professeur d'intervenir brièvement pour rediriger la trajectoire avant que l'élève ne reprenne.

  • Utilise un professeur Qwen3-4B-Instruct-2507 avec des élèves Qwen3-0.6B/1.7B-Non-Thinking sur huit benchmarks de raisonnement mathématique.
  • Obtient les meilleurs ou deuxièmes meilleurs résultats sur chaque benchmark, surpassant la OPD standard de +5,73 % et la FastOPD de +1,49 % en moyenne pour le modèle 1,7B.
  • Des gains cohérents sont observés à l'échelle 0,6B, tandis que la longueur de la trajectoire d'entraînement est réduite de plus de 50 %.

Cette approche concentre l'intervention sur des positions précoces critiques via un budget de relais limité, limitant l'écart par rapport à la politique de l'élève tout en améliorant significativement l'efficacité et la précision.