Qwen टीम ने Qwen3.8-Flash-Next मॉडल जारी किया है, जो अब ModelScope पर उपलब्ध है।
इस रिलीज़ में Qwen3.8-Flash श्रृंखला में एक नई भिन्नता पेश की गई है।
Qwen टीम ने Qwen3.8-Flash-Next मॉडल जारी किया है, जो अब ModelScope पर उपलब्ध है।
इस रिलीज़ में Qwen3.8-Flash श्रृंखला में एक नई भिन्नता पेश की गई है।
एंट ग्रुप ने एंट लिंग परिवार का पहला वित्त-सुधारा मॉडल, Ling-3.0-flash-Fin का ओपन सोर्स किया है, जिसका विकास प्रमुख वित्तीय संस्थानों और क्षेत्र विशेषज्ञों के साथ मिलकर किया गया।
Alibaba ने अपने बड़े भाषा मॉडल, Qwen3.8-Max-0902 का एक अपग्रेडेड वर्जन जारी किया है। नए मॉडल में 2.4 ट्रिलियन पैरामीटर हैं और यह 1 मिलियन टोकन के संदर्भ विंडो का समर्थन करता है।
इस सप्ताह की AI खबरों में Z.ai, Tencent और Alibaba से महत्वपूर्ण ओपन-वेट मॉडल रिलीज़ के साथ-साथ इन्फरेंस इंफ्रास्ट्रक्चर और एजेंट बेंचमार्किंग में विकास पर प्रकाश पड़ता है।
अलीबाबा की Qwen टीम ने Qwen3.8-Flash-Next जारी किया है, एक ओपन-वेट मल्टीमोडल मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल जो आगामी Qwen4 सीरीज़ के लिए आर्किटेक्चर का पूर्वावलोकन प्रस्तुत करने के लिए डिज़ाइन किया गया है। चेकपॉइंट में 125B बैकबोन, 51B N-ग्राम एम्बेडिंग टेबल और 4B मल्टी-टोकन प्रिडिक्शन मॉड्यूल शामिल हैं, जिसमें प्रति टोकन केवल 6B पैरामीटर सक्रिय होते हैं।
लेखकों ने क्वांटीज़ेशन-अवेयर हीलिंग (QAH) पेश किया, एक पाइलाइन जो संरचनात्मक संपीड़न और क्वांटीज़ेशन के दौरान खोए गए प्रदर्शन को पुनर्स्थापित करने के लिए अदबाई मॉडलों से सीधे 4-बिट छात्रों को डिस्टिल करता है। GPT-OSS 120B पर लागू, यह विधि Hypernova-60B उत्पन्न करती है, जो 9 में से 7 बेंचमार्क्स पर bfloat16 स्रोत के बराबर या बेहतर प्रदर्शन देता है जबकि लगभग 4 गुना कम वजन मेमोरी का उपयोग करता है।
हम ट्रैफ़िक मापने और साइट को बेहतर बनाने के लिए कुकीज़ का उपयोग करते हैं। आप एनालिटिक्स कुकीज़ स्वीकार या अस्वीकार कर सकते हैं। गोपनीयता नीति