Les chercheurs présentent la Distillation de Puissance On-Policy (OPPD), une méthode qui entraîne les modèles à générer des réponses de haute qualité en un seul passage en imitant la distribution de probabilité affinée d'un modèle enseignant. Cette approche élimine le besoin d'un échantillonnage extensif de candidats pendant l'inférence tout en augmentant significativement les performances sur les benchmarks mathématiques et de codage.

  • OPPD utilise un échantillonneur Monte Carlo séquentiel où la distribution de puissance d'un enseignant figé pondère les candidats générés par le modèle élève pour des mises à jour de vraisemblance maximale.
  • La méthode augmente la précision de génération unique jusqu'à 23,0 points sur MATH500 et 27,3 points sur GSM8K par rapport à la ligne de base non entraînée à la même température.
  • Une seule génération du modèle distillé surpasse l'échantillonnage de puissance avec 64 candidats, récupérant 94 pour cent du gain fourni par 16 candidats dans le modèle non entraîné.
  • OPPD obtient des scores supérieurs à GRPO entraîné avec des récompenses vérifiées sur MATH500, GSM8K et AIME sans utiliser de réponses de référence, et peut ajouter jusqu'à 9,3 points lorsqu'il est appliqué après GRPO.
  • La technique augmente la précision de HumanEval jusqu'à 5,3 points et maintient les gains à travers différentes familles et tailles de modèles.

Cette méthode permet aux modèles d'atteindre des améliorations de raisonnement nécessitant habituellement un échantillonnage intensif ou des données de référence supplémentaires via des mises à jour directes des paramètres.