Les chercheurs présentent la Zone of Proximal Policy Optimization (ZPPO), une méthode qui injecte les connaissances du professeur dans les invites plutôt que dans les gradients de politique, afin de pallier la fragilité de la distillation des connaissances et la dérive en apprentissage par renforcement. ZPPO construit des Binary Candidate-included Questions (BCQ) et des Negative Candidate-included Questions (NCQ) pour les questions difficiles, en les recirculant via un tampon de rejeu jusqu'à ce que la précision de l'étudiant s'améliore ou qu'elles soient évacuées.

  • ZPPO associe une réponse correcte du professeur à une réponse incorrecte de l'étudiant dans les BCQ pour forcer la discrimination, tandis que les NCQ agrègent les échecs de l'étudiant pour révéler des modes d'erreur partagés.
  • La méthode a été testée sur la famille Qwen3.5 aux échelles de 0,8B à 9B en utilisant un modèle professeur de 27B.
  • Les évaluations ont porté sur un ensemble de 31 benchmarks incluant 16 tâches VLM, 10 LLM et 5 vidéos.
  • ZPPO dépasse la distillation hors/hors politique et GRPO, avec les gains les plus importants observés à l'échelle de modèle la plus petite.

En maintenant le professeur dans l'invite plutôt que dans le gradient de politique, ZPPO évite de briser les hypothèses de politique en cours tout en amplifiant l'apprentissage au sein de la zone de développement proximal actuelle de l'étudiant.