Pesquisadores propõem um novo framework de destilação pensar-responder que melhora a capacidade de modelos visuo-linguísticos compactos de utilizar evidência visual ao mascarar prefixos de raciocínio salientes. Esta abordagem aborda o problema do "esquecimento visual" comum em rastros longos de pensar-responder, onde os estudantes perdem o foco nas pistas visuais durante o raciocínio estendido.

O método emprega mascaramento de prefixo de raciocínio saliente por token para bloquear seletivamente pistas textuais de alta influência e uma estratégia de agendamento de orçamento de mascaramento auto-paced que escala com a dificuldade da destilação. Durante o treinamento, essas máscaras substituem as máscaras causais padrão para forçar o modelo estudante a depender mais de informações visuais para a previsão do próximo token.

Os resultados experimentais indicam que esta abordagem supera VLMs open-source recentes, destilação de VLM e métodos de auto-destilação em benchmarks de raciocínio multimodal, com análise confirmando o uso visual aprimorado durante todo o processo de pensamento.