研究人员提出了一种新颖的思考-回答蒸馏框架,通过掩码显著推理前缀,提高了紧凑视觉语言模型利用视觉证据的能力。这种方法解决了长思考-回答轨迹中常见的“视觉遗忘”问题,学生在扩展推理过程中会失去对视觉线索的关注。

该方法采用逐 token 的显著推理前缀掩码,选择性屏蔽高影响力文本线索,并采用与蒸馏难度成比例的自步掩码预算调度策略。在训练期间,这些掩码替换了标准因果掩码,迫使学生模型更依赖视觉信息进行下一个 token 预测。

实验结果表明,该方法在多模态推理基准测试中优于最近的开源 VLM、VLM 蒸馏和自蒸馏方法,分析证实了整个思考过程中视觉利用能力的增强。