मेटा ने Muse Glimmer जारी किया है, जो Hugging Face Hub पर ओपन सोर्स के रूप में उपलब्ध एक घना 30B पैरामीटर वाला मल्टीमोडल मॉडल है। आर्किटेक्चर में 28B टेक्स्ट डिकोडर और विजन टास्क के लिए 2B ViT-शैली Perception Encoder शामिल हैं।
- टेक्स्ट डिकोडर स्लाइविंग विंडोज़ और पूर्ण एटेंशन लेयर्स के साथ हाइब्रिड एटेंशन का उपयोग करता है, साथ ही KV-cache मेमोरी को 16x कम करने के लिए Gated Grouped-Query Attention का उपयोग करता है।
- मॉडल वीडियो इनफरेंस का समर्थन करता है, जो फ्रेमों को सेकंड में 2 फ्रेम की दर से प्रोसेस करता है, क्लिप्स को 96 फ्रेम तक सीमित करता है।
- transformers, llama.cpp, vLLM और Inference Endpoints के लिए Day-0 समर्थन प्रदान किया गया है।
- संरचित सामग्री जैसे कोडिंग के लिए जनरेशन को तेज करने के लिए एक वैकल्पिक DFlash स्पेकुलेटिव डिकोडिंग ड्राफ्टर शामिल है।
रिलीज NVIDIA, AMD और Intel एक्सेलेरेटरों के बीच व्यापक हार्डवेयर संगतता के साथ एजेंटिक मल्टीमोडल क्षमताओं के स्थानीय तौर पर डिप्लॉयमेंट को सक्षम बनाती है।