연구자들은 시각적 증거를 활용하는 컴팩트한 비전-라ngu아지 모델의 능력을 향상시키는 새로운 생각-답변 증류 프레임워크를 제안했습니다. 이는 중요한 추론 접두사를 마스킹하여 달성됩니다. 이 접근 방식은 긴 생각-답변 추적에서 일반적으로 발생하는 "시각적 망각" 문제를 해결합니다. 학생들은 확장된 추론 동안 시각적 단서에 대한 집중력을 잃습니다.

이 방법은 토큰 단위의 중요한 추론 접두사 마스킹을 사용하여 높은 영향력의 텍스트 단서를 선택적으로 차단하고, 증류 난이도에 따라 스케일링되는 자기 paced 마스킹 예산 스케줄링 전략을 사용합니다. 훈련 중 이러한 마스크는 표준 인과적 마스크를 대체하여 학생 모델이 다음 토큰 예측을 위해 시각 정보에 더 많이 의존하도록 강요합니다.

실험 결과는 이 접근 방식이 다중 모달 추론 벤치마크에서 최근의 오픈 소스 VLM, VLM 증류 및 자기 증류 방법보다 우수함을 나타내며, 분석은 사고 과정 전반에 걸쳐 향상된 시각적 활용을 확인했습니다.