inclusionAI ने ओपन-सोर्स Ling-3.0-flash-VL मॉडल जारी किया है, जो अपनी पूर्ववर्ती की भाषा और तर्क क्षमताओं को प्राकृतिक छवि और वीडियो समझ के साथ बढ़ाता है।

124B पैरामीटर वाले मॉडल में प्रति टोकन केवल 5.5B पैरामीटर सक्रिय होते हैं और यह 1M टोकन तक के संदर्भ विंडो का समर्थन करता है। इसकी आर्किटेक्चर में MLP प्रोजेक्टर द्वारा संरेखित ViT विज़ुअल एन्कोडर, समयिक एन्कोडिंग के लिए VideoRoPE, और KDA और Gated MLA परतों को बारी-बारी से जोड़ने वाला हाइब्रिड बैकबोन शामिल है।

यह डिज़ाइन वास्तविक दुनिया के तर्क और एजेंटिक वर्कफ़्लो में विज़ुअल जानकारी को एकीकृत करता है, जबकि स्पार्स मिक्स्चर ऑफ एक्सपर्ट्स के माध्यम से इनफरेंस दक्षता बनाए रखता है।