माइक्रोसॉफ्ट ने मैज-वीएल जारी किया है, जो छवि और वीडियो समझ के लिए एक कुशल 4B-पैरामीटर मल्टीमोडल फाउंडेशन मॉडल है जो दृश्य प्रसंस्करण को सरल बनाने के लिए एक कोडेक-नेटिव दृष्टिकोण का उपयोग करता है। सिस्टम वीडियो स्ट्रीम को एंकर (I) फ्रेम और पूर्वानुमानित (P) फ्रेम में अलग करता है, केवल उन पैच को बनाए रखता है जहां कोडेक बिट्स आवंटित करता है, जिससे दृश्य टोकन की खपत 75% से अधिक कम हो जाती है।
- मैज-वीएल शून्य से बना Codec-ViT दृश्य एन्कोडर और Qwen3-4B कारण डिकोडर भाषा बैकबोन को जोड़ता है।
- आर्किटेक्चर समान फ्रेम सैंपलिंग की तुलना में स्थान-समय संदर्भ को बनाए रखते हुए 3.5× तक दीवार-घड़ी अनुमान गति में वृद्धि प्राप्त करता है।
- सिस्टम 1 और सिस्टम 2 द्वैत-प्रक्रिया डिज़ाइन प्रोएक्टिव स्ट्रीमिंग जोड़ता है, जिसमें एक हल्का संज्ञान गेट का उपयोग करके केवल आवश्यक होने पर पूर्ण VLM को बुलाया जाता है।
- वीडियो बेंचमार्क पर, मैज-वीएल प्रतिवेदित प्रत्येक मेट्रिक पर Qwen3-VL-4B पर सुधार करता है, जैसे कि +22.5 के महत्वपूर्ण लाभ के साथ स्थानीयकरण-केंद्रित कार्यों में।
मॉडल जटिल ऑफलाइन तर्क और रियल-टाइम स्ट्रीमिंग संवेदनशीलता के बीच व्यापार का लक्ष्य रखता है, कम विलंबता घटना-गेटेड टिप्पणी के लिए एक सिंगल-मॉडल समाधान प्रदान करता है।