Les chercheurs proposent un nouveau cadre de distillation penser-réponse qui améliore la capacité des modèles visuo-linguistiques compacts à utiliser des preuves visuelles en masquant les préfixes de raisonnement saillants. Cette approche aborde le problème de l'"oubli visuel" courant dans les traces longues de penser-réponse, où les étudiants perdent le focus sur les indices visuels pendant le raisonnement étendu.

La méthode emploie un masquage de préfixe de raisonnement saillant au niveau du token pour bloquer sélectivement les indices textuels à haute influence et une stratégie de planification de budget de masquage auto-paced qui évolue avec la difficulté de la distillation. Pendant l'entraînement, ces masques remplacent les masques causaux standard pour forcer le modèle étudiant à s'appuyer davantage sur l'information visuelle pour la prédiction du prochain token.

Les résultats expérimentaux indiquent que cette approche surpasse les VLM open-source récents, la distillation VLM et les méthodes d'auto-distillation sur les benchmarks de raisonnement multimodal, avec une analyse confirmant une utilisation visuelle améliorée tout au long du processus de pensée.