Microsoft ha lanzado Mage-VL, un modelo base multimodal eficiente de 4B de parámetros para la comprensión de imágenes y video que utiliza un enfoque nativo de códec para optimizar el procesamiento visual. El sistema separa los flujos de video en fotogramas ancla (I) y predichos (P), conservando solo los parches donde el códec asigna bits para reducir el consumo de tokens visuales en más del 75%.

  • Mage-VL combina un codificador visual Codec-ViT desde cero con una columna vertebral de lenguaje decodificador causal Qwen3-4B.
  • La arquitectura logra hasta 3.5× mayor velocidad de inferencia en tiempo real respecto al muestreo uniforme de fotogramas, preservando el contexto espaciotemporal.
  • Un diseño de doble proceso System 1 & System 2 añade streaming proactivo, utilizando un filtro cognitivo ligero para invocar el VLM completo solo cuando es necesario.
  • En benchmarks de video, Mage-VL mejora a Qwen3-VL-4B en todas las métricas reportadas, con ganancias significativas en tareas centradas en la localización como +22.5 en QVHighlight.

El modelo apunta al equilibrio entre el razonamiento complejo fuera de línea y la percepción de streaming en tiempo real, ofreciendo una solución de un solo modelo para comentarios activados por eventos de baja latencia.