Microsoft выпустила Mage-VL, эффективную мультимодельную базовую модель на 4 млрд параметров для понимания изображений и видео, использующую подход с нативным кодеком для оптимизации визуальной обработки. Система разделяет видеопотоки на опорные (I) кадры и предсказанные (P) кадры, сохраняя только те патчи, которым кодек выделяет биты, что снижает потребление визуальных токенов более чем на 75%.
- Mage-VL сочетает визуальный энкодер Codec-ViT, разработанный с нуля, с языковой основой декодера Qwen3-4B причинного типа.
- Архитектура обеспечивает ускорение инференса во времени до 3,5× по сравнению с равномерной выборкой кадров при сохранении пространственно-временного контекста.
- Двухпроцессная система «Система 1 & Система 2» добавляет проактивную потоковую передачу, используя легкий шлюз когнитивных процессов для вызова полной VLM только при необходимости.
- На видеобенчмарках Mage-VL превосходит Qwen3-VL-4B по всем указанным метрикам, демонстрируя значительный прогресс в задачах, требующих локализации, таких как +22.5 на QVHighlight.
Модель направлена на баланс между сложным офлайн-рассуждением и восприятием в реальном времени, предлагая решение с одной моделью для комментариев с низкой задержкой, активируемых событиями.