Les chercheurs présentent la Distillation de Puissance On-Policy (OPPD), une méthode qui entraîne les modèles de langage à générer des réponses de haute qualité en un seul passage en imitant la distribution de probabilité affinée d'un modèle enseignant. Cette approche élimine le besoin d'un échantillonnage extensif de candidats lors de l'inférence tout en améliorant significativement les performances sur les tâches de raisonnement.

  • OPPD utilise un échantillonneur Monte Carlo séquentiel où la distribution de puissance d'un enseignant figé pondère les candidats générés par le modèle en cours d'entraînement.
  • La méthode augmente la précision de la génération unique jusqu'à 23,0 points sur MATH500 et 27,3 sur GSM8K par rapport au modèle non entraîné à la même température.
  • Une seule génération du modèle distillé surpasse l'échantillonnage de puissance publié avec 64 candidats, récupérant 94 pour cent du gain fourni par 16 candidats dans le modèle non entraîné.
  • OPPD obtient des scores supérieurs à GRPO sur MATH500, GSM8K et AIME sans utiliser de réponses de référence, et peut ajouter jusqu'à 9,3 points lorsqu'il est appliqué après GRPO.
  • La technique augmente également la précision de HumanEval jusqu'à 5,3 points et fonctionne à travers différentes familles et tailles de modèles.

OPPD offre un moyen économe en paramètres d'améliorer les capacités de raisonnement sans modifier l'architecture du modèle ni nécessiter une inférence basée sur la recherche.