A Microsoft lançou o Mage-VL, um modelo de fundação multimodal eficiente com 4B de parâmetros para compreensão de imagens e vídeos que utiliza uma abordagem nativa para codec a fim de simplificar o processamento visual. O sistema separa os fluxos de vídeo em quadros âncora (I) e quadros previstos (P), retendo apenas os patches onde o codec aloca bits, reduzindo o consumo de tokens visuais em mais de 75%.

  • O Mage-VL combina um codificador visual Codec-ViT desenvolvido do zero com uma espinha dorsal de linguagem baseada em decodificador causal Qwen3-4B.
  • A arquitetura alcança até 3,5× de aceleração no tempo de inferência em relação à amostragem uniforme de quadros, preservando o contexto espaço-temporal.
  • Um design de processo dual System 1 & System 2 adiciona streaming proativo, utilizando um gate de cognição leve para invocar o VLM completo apenas quando necessário.
  • Nos benchmarks de vídeo, o Mage-VL supera o Qwen3-VL-4B em todas as métricas reportadas, com ganhos significativos em tarefas focadas em localização, como +22,5 no QVHighlight.

O modelo visa o equilíbrio entre raciocínio offline complexo e percepção de streaming em tempo real, oferecendo uma solução de modelo único para comentários acionados por eventos com baixa latência.