Microsoft a publié Mage-VL, un modèle de base multimodal efficace de 4 milliards de paramètres pour la compréhension d'images et de vidéos, qui utilise une approche native par codec pour rationaliser le traitement visuel. Le système sépare les flux vidéo en images ancrées (I) et images prédites (P), ne conservant que les patches où le codec alloue des bits afin de réduire la consommation de tokens visuels de plus de 75 %.
- Mage-VL associe un encodeur visuel Codec-ViT conçu à partir de zéro à une colonne vertébrale de décodeur causal Qwen3-4B.
- L'architecture offre jusqu'à un gain de vitesse d'inférence en temps réel de 3,5× par rapport à l'échantillonnage uniforme des images tout en préservant le contexte spatio-temporel.
- Une conception à double processus System 1 & System 2 ajoute un streaming proactif, utilisant une porte de cognition légère pour invoquer le VLM complet uniquement lorsque cela est nécessaire.
- Sur les benchmarks vidéo, Mage-VL améliore Qwen3-VL-4B sur toutes les métriques rapportées, avec des gains significatifs dans les tâches lourdes en localisation comme +22,5 sur QVHighlight.
Le modèle vise le compromis entre le raisonnement hors ligne complexe et la perception en streaming en temps réel, offrant une solution à modèle unique pour les commentaires déclenchés par des événements à faible latence.