أطلقت مايكروسوفت Mage-VL، وهو نموذج أساسي متعدد الوسائط بكفاءة عالية يحتوي على 4 مليار معلمة لفهم الصور والفيديو، يعتمد على نهج مشفر أصلي لتبسيط المعالجة البصرية. يفصل النظام تدفقات الفيديو إلى إطارات مرجعية (I) وإطارات متوقعة (P)، مع الاحتفاظ فقط بالبقع التي تخصص لها المشفر بتات لتقليل استهلاك الرموز البصرية بنسبة تزيد عن 75%.
- يجمع Mage-VL بين مشفر بصري Codec-ViT مُصمم من الصفر مع هيكل أساسي لغوي تفسيري Qwen3-4B.
- يحقق هذا الهيكل تسريعًا في زمن الاستدلال الفعلي يصل إلى 3.5 مرات مقارنة بأخذ العينات المنتظمة للإطارات، مع الحفاظ على السياق المكاني والزمني.
- يضيف تصميم العملية المزدوجة (النظام 1 والنظام 2) البث الاستباقي، باستخدام بوابة إدراك خفيفة الوزن لاستدعاء نموذج VLM الكامل فقط عند الضرورة.
- في معايير الفيديو، يتفوق Mage-VL على Qwen3-VL-4B في كل مقياس مُبلغ عنه، مع مكاسب كبيرة في المهام التي تعتمد بشكل كبير على التموضع مثل +22.5 في QVHighlight.
يستهدف النموذج الموازنة بين الاستدلال المعقد غير المتزامن والإدراك البث المباشر، ويقدم حلاً بنموذج واحد للتعليق التلقائي المبني على أحداث زمنية منخفضة التأخير.