U-OPSD permet l'auto-distillation non supervisée sur politique pour les LLM
Les chercheurs proposent l'Auto-Distillation Non Supervisée sur Politique (U-OPSD), une méthode qui améliore les performances post-entraînement des grands modèles de langage en utilisant uniquement les générations du modèle lui-même, sans supervision externe. L'approche échantillonne plusieurs rollouts pour construire une pseudo-solution par vote majoritaire, puis distille la distribution d'un enseignant dans les préfixes de la complétion incorrecte la plus longue du modèle.