पिछले महीने में चीन में चार बड़े भाषा मॉडल जारी किए गए हैं: Kimi K3-2.8T, Qwen3.8-2.4T, DeepSeek-V4-Pro-0813-1.6T और GLM-5.3-743B.
Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813 और GLM-5.3 एक महीने में जारी
xAI ने Grok 4.6 जारी किया; Alibaba ने Qwen3.8-MoE को खोला; DeepSeek V4 Pro GA
इस सप्ताह की AI समाचारों में xAI, Alibaba और DeepSeek से प्रमुख रिलीज़ के साथ-साथ ओपन वीडियो मॉडल और इनफ्रेंस इंफ्रास्ट्रक्चर में अपडेट भी शामिल हैं।
Thinking Machines ने Inkling जारी किया, Tencent ने Apache 2.0 लाइसेंस के साथ Hy3 को अपडेट किया
ओपन मॉडल आर्टिफैक्ट्स की ताज़ा समीक्षा में Thinking Machines और Tencent से महत्वपूर्ण रिलीज़ और Poolside तथा DeepSeek से अपडेट्स उभरकर सामने आए हैं।
Qwen3.8 ओपन-वेट रिलीज, Kimi Code CLI, Netflix LLM स्टैक, Alibaba चिप सॉफ्टवेयर
Alibaba ने 2.4-ट्रिलियन-पैरामीटर वाले मॉडल Qwen3.8 की ओपन-वेट रिलीज की घोषणा की, साथ ही Nvidia के CUDA इकोसिस्टम पर निर्भरता कम करने के लिए अपने Zhenwu AI चिप सॉफ्टवेयर स्टैक को ओपन-सोर्स किया।
बेंचमार्क, लाइसेंस और सर्विंग लागत पर Kimi K3, DeepSeek V4 Pro और GLM-5.2 की तुलना
तीन ओपन-वेट स्पर्स मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल्स—Moonshot AI का Kimi K3, DeepSeek V4 Pro, और Zhipu AI का GLM-5.2—की तुलना लंबे समय तक चलने वाले कोडिंग और एजेंट वर्कलोड के लिए उनकी क्षमताओं, लाइसेंस शर्तों और सर्विंग लागत के आधार पर की गई है।
deepseek-r1:8B को Qwen3-0.6B में संघनित करने से डिवाइस पर तेज़ संरचित पाठ समृद्धि सक्षम होती है
शोधकर्ताओं ने दिखाया कि 8B तर्क शिक्षक (deepseek-r1:8B) को QLoRA के माध्यम से 0.6B छात्र मॉडल (Qwen3-0.6B) में संघनित करना, कम विलंबता और लागत के साथ उच्च-आयतन संरचित निष्कर्षण की अनुमति देता है। अध्ययन समाचार लेखों को सारांश और वर्गीकरण लेबल वाले JSON ऑब्जेक्ट्स में मैप करने पर इस दृष्टिकोण का मूल्यांकन करता है, जिसमें संघनित मॉडल की तुलना फ़ew-शॉट प्रॉम्प्टिंग और प्रतिबंधित डिकोडिंग आधार रेखाओं से की जाती है।