Microsoft는 이미지 및 비디오 이해를 위한 효율적인 4B 파라미터 멀티모달 파운데이션 모델인 Mage-VL을 출시했으며, 이는 시각적 처리를 간소화하기 위해 코덱 네이티브 접근 방식을 사용합니다. 이 시스템은 비디오 스트림을 앵커(I) 프레임과 예측(P) 프레임으로 분리하고, 코덱이 비트를 할당하는 패치만 유지하여 시각적 토큰 소비를 75% 이상 줄입니다.

  • Mage-VL은 처음부터 구축된 Codec-ViT 시각 인코더와 Qwen3-4B 인과 디코더 언어 백본을 결합합니다.
  • 이 아키텍처는 시공간 맥락을 보존하면서 균일한 프레임 샘플링 대비 최대 3.5배의 실제 추론 속도 향상을 달성합니다.
  • System 1 & System 2 듀얼 프로세스 설계는 경량 인지 게이트를 사용하여 필요한 경우에만 전체 VLM을 호출하는 능동적 스트리밍을 추가합니다.
  • 비디오 벤치마크에서 Mage-VL은 보고된 모든 지표에서 Qwen3-VL-4B보다 개선되었으며, QVHighlight에서 +22.5와 같은 로컬라이제이션 중심 작업에서 상당한 향상을 보였습니다.

이 모델은 복잡한 오프라인 추론과 실시간 스트리밍 지각 간의 균형을 목표로 하며, 낮은 지연 시간의 이벤트 기반 주석을 위한 단일 모델 솔루션을 제공합니다.