Исследователи предлагают новую фреймворк дистилляции «мышление-ответ», который улучшает способность компактных зрительно-языковых моделей использовать визуальные доказательства путем маскирования значимых префиксов рассуждения. Этот подход решает проблему «визуального забывания», распространенную в длинных треках «мышление-ответ», где студенты теряют фокус на визуальных подсказках во время расширенного рассуждения.

Метод использует посимвольное маскирование значимых префиксов рассуждения для селективного блокирования высоко-влияющих текстовых подсказок и стратегию планирования бюджета маскирования с само-paced масштабирующуюся в зависимости от сложности дистилляции. Во время обучения эти маски заменяют стандартные каузальные маски, заставляя модель-студент больше полагаться на визуальную информацию для предсказания следующего токена.

Экспериментальные результаты показывают, что этот подход превосходит недавние открытые VLM, дистилляцию VLM и методы самодистилляции на мультимодальных бенчмарках рассуждений, с анализом, подтверждающим улучшенное использование визуальной информации в течение всего процесса мышления.