थिंकिंग मशीन्स लैब ने इंकलिंग-स्माल रिलीज़ किया, जो 276 बिलियन कुल पैरामीटर और 12 बिलियन एक्टिव पैरामीटर वाला एक ओपन-वेट्स मिक्चर-ऑफ़-एक्सपर्ट्स मॉडल है। इस मॉडल को टेक्स्ट, छवियों और ऑडियो पर स्वदेशी रूप से तर्क करने के लिए प्रशिक्षित किया गया है, जिसमें 1M टोकन संदर्भ विंडो और समायोज्य सोचने की मेहनत शामिल है।
- वेट्स Hugging Face पर Apache 2.0 के तहत उपलब्ध हैं, जहाँ BF16 को 600 GB VRAM की आवश्यकता होती है और NVFP4 क्वांटीज़ेशन इसे घटाकर 180 GB कर देता है।
- आर्किटेक्चर में 42 डिकोडर परतें हैं, जहाँ प्रत्येक टोकन 256 एक्सपर्ट्स में से 6 और 2 शेयर्ड एक्सपर्ट्स की ओर रूट होता है, छवियों को पैच के माध्यम से और ऑडियो को dMel स्पेक्ट्रोग्राम के रूप में प्रोसेस करता है।
- इंकलिंग-स्माल ने Humanity's Last Exam (31.6% बनाम 29.7%) और SWE-bench Verified (80.2% बनाम 77.6%) जैसे तर्क बेंचमार्क्स पर अपने बड़े टीचर मॉडल इंकलिंग को पार कर लिया है।
- तथ्यात्मक स्मृति में महत्वपूर्ण गिरावट आई है, SimpleQA Verified 43.9% से घटकर 20.6% हो गया है, जबकि मल्टीमोडल स्कोर बड़े मॉडल के करीब बने रहे हैं।
यह रिलीज़ स्टार्टअप्स और एंटरप्राइजेज को सिंगल या डुअल GPU सेटअप पर फ्रंटियर-सक्षम मॉडल को स्वयं होस्ट करने की अनुमति देती है, जिसमें कोडिंग एजेंट्स, टर्मिनल ऑटोमेशन और कॉल-सेंटर एनालिटिक्स जैसे वर्कलोड शामिल हैं।