Los investigadores proponen un nuevo marco de destilación pensar-responder que mejora la capacidad de los modelos visuo-lingüísticos compactos para utilizar evidencia visual mediante el enmascaramiento de prefijos de razonamiento salientes. Este enfoque aborda el problema del "olvido visual" común en rastros largos de pensar-responder, donde los estudiantes pierden el foco en las pistas visuales durante el razonamiento extendido.
El método emplea enmascaramiento de prefijos de razonamiento saliente a nivel de token para bloquear selectivamente pistas textuales de alta influencia y una estrategia de programación de presupuesto de enmascaramiento auto-pacing que escala con la dificultad de destilación. Durante el entrenamiento, estas máscaras reemplazan las máscaras causales estándar para forzar al modelo estudiante a depender más de la información visual para la predicción del siguiente token.
Los resultados experimentales indican que este enfoque supera a los VLMs recientes de código abierto, destilación VLM y métodos de auto-destilación en benchmarks de razonamiento multimodal, con análisis confirmando una mejor utilización visual durante todo el proceso de pensamiento.