Les chercheurs proposent l'Auto-Distillation Non Supervisée sur Politique (U-OPSD), une méthode qui améliore les performances post-entraînement des grands modèles de langage en utilisant uniquement les générations du modèle lui-même, sans supervision externe. L'approche échantillonne plusieurs rollouts pour construire une pseudo-solution par vote majoritaire, puis distille la distribution d'un enseignant dans les préfixes de la complétion incorrecte la plus longue du modèle.
- U-OPSD améliore les modèles de base de 8,5 % et 10,7 % sur Qwen3 en mode non-réfléchi aux échelles 4B et 8B sur des benchmarks comme AIME24, MATH500 et AMC23.
- Il surpasse les méthodes supervisées telles que OPSD d'une moyenne de 3,2 % et 2,3 % en mode non-réfléchi.
- En mode réfléchi, U-OPSD égale ou dépasse OPSD et GRPO, surpassant ce dernier jusqu'à 1,1 % à l'échelle 8B.
Cette méthode démontre qu'une véritable auto-distillation est possible grâce à la cohérence interne, offrant une alternative compétitive aux signaux d'entraînement supervisés.