Les chercheurs proposent Masters, un cadre d'apprentissage par renforcement progressif par masquage pour distiller des modèles vision-langage à grande échelle en versions compactes adaptées au déploiement en périphérie. La méthode traite l'instabilité causée par l'écart de taille entre les modèles professeur et étudiant.

  • Masters masque les poids non dominants du professeur pour réduire la complexité, puis restaure progressivement la capacité pendant l'entraînement pour permettre un apprentissage plus fluide.
  • Il intègre une étape RL hors ligne utilisant des réponses pré-générées à partir de professeurs masqués, évitant le coût computationnel des paradigmes de réflexion-réponse en ligne.
  • Le cadre emploie deux récompenses complémentaires : une récompense de précision pour la correction de la réponse et une récompense de distillation quantifiant la facilité de transfert.

Cette approche permet aux étudiants d'atteindre de solides performances en tirant parti d'un guidage riche mais efficace, sans nécessiter de longs processus de génération de réponses.