अलिबाबा ने अप्सरा सम्मेलन में Qwen 4 की घोषणा की
अलिबाबा ने अप्सरा सम्मेलन के दौरान Qwen 4 के रिलीज़ की आधिकारिक तौर पर घोषणा की है।
अलिबाबा ने अप्सरा सम्मेलन के दौरान Qwen 4 के रिलीज़ की आधिकारिक तौर पर घोषणा की है।
अलibaba की Qwen टीम ने Qwen3.8-Omni-Flash जारी किया है, जो ऑडियो-वीडियो समझ और टूल उपयोग के लिए एजेंटिक क्षमताओं के आसपास डिज़ाइन किया गया उनका पहला ओमनी-मोडल मॉडल है। मॉडल टेक्स्ट, छवियों, ऑडियो और वीडियो इनपुट स्वीकार करता है ताकि टेक्स्ट आउटपुट वापस ला सके, जिसमें 1M-टोकन संदर्भ विंडो और नेटिव फंक्शन कॉलिंग शामिल हैं।
अलibaba के क्वेन टीम ने क्वेन-ऑडियो-3.1 जारी किया है, जो एक पांच-मॉडल ऑडियो स्टैक है जिसमें नया क्वेन-ऑडियो-3.1-रियलटाइम-प्लस शामिल है, जो वॉइस एजेंट्स के लिए डिज़ाइन किया गया एक फुल-डप्लेक्स स्पीच मॉडल है जो तर्क और टूल उपयोग की क्षमता रखता है। इस रिलीज़ में ASR सेवाओं पर 95% तक की कीमत में कमी भी शामिल है।
ISTA डीप एल्गोरिदम और सिस्टम्स लैब ने विरल मिक्स्चर-ऑफ़-एक्सपर्ट्स मॉडल Qwen3.8-Flash-Next के क्वांटाइज्ड GGUF संस्करण जारी किए हैं, साथ ही एक प्रयोगात्मक क्षमता-लक्षित बिल्ड भी जारी की गई है जिसमें इसके आधे विशेषज्ञों को हटा दिया गया है।
लेखकों ने RareDx पेश किया, एक सिस्टम जो नियंत्रित प्रमाण उपयोग को ज्ञान-ग्राफ-ग्राउंडेड पॉलिसी ऑप्टिमाइज़ेशन के साथ जोड़ता है दुर्लभ-रोग निदान की लंबी-छाया तर्क समस्या को हल करने के लिए। प्रशिक्षण पाइपलाइन Top-10 पोस्ट-ट्रेनिंग को RareDx-KGPO के साथ जोड़ती है, जो भविष्यवाणियों को एक मानकीकृत रोग ग्राफ में प्रोजेक्ट करता है और संपादित स्तरित प्रासंगिकता, ऑन्टोलॉजी निकटता, बायोमेडिकल समानता, और लक्षण स्थिरता को एकीकृत करता है।
शोधकर्ताओं ने Visual Answerability Diagnosis with Rationales (VAD-R) का परिचय दिया, एक नया बेंचमार्क जो दृश्य-भाषा मॉडलों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है कि वे शॉर्टकट संकेतों के बिना उत्तर देने योग्य नहीं होने वाले प्रश्नों से कैसे बचते हैं। अध्ययन से पता चलता है कि छिपी हुई अवस्थाएँ उत्तर देने की क्षमता को अलग कर सकती हैं, लेकिन वर्तमान मॉडल इसे स्पष्ट निर्णयों में परिवर्तित करने में विफल रहते हैं।
VHD-Play एक पाइपलाइन है जो गणितीय मॉडलों को सैंपल और हल करने के बाद उनके निर्णय प्रक्रियाओं को स्टेटफुल टूल्स के रूप में रेंडर करके विविध एजेंटिक रिइन्फोर्समेंट लर्निंग पर्यावरण उत्पन्न करता है। यह दृष्टिकोण सुनिश्चित करता है कि निष्पादन योग्य गतिशीलता और ट्राजेक्टरी-स्कोरिंग संदर्भ सीधे हल किए गए मॉडल से विरासत में मिलें, जो मौजूदा जनरेशन पाइपलाइनों में सामान्य असंगति समस्याओं को दूर करता है।
शोधकर्ताओं ने SkillGym पेश किया, एक फ्रेमवर्क जो मानव-लेखित एजेंट कौशल को बड़े भाषा मॉडल एजेंट्स के लिए निष्पादन योग्य और सत्यापन योग्य प्रशिक्षण वातावरणों में परिवर्तित करता है। सिस्टम एक skill-to-task पाइपलाइन का उपयोग करके ठोस कार्यों को तैनात करता है और कोड-आधारित चेकरों के साथ परिणामों की पुष्टि करता है।
शोधकर्ताओं ने VideoX-Qwen प्रस्तुत किया, एक एकीकृत ढांचा जो स्केलेबल डेटा निर्माण को मॉडल प्रशिक्षण के साथ जोड़ता है ताकि सामान्य-उद्देश्य, निर्देश-चालित वीडियो संपादन को आगे बढ़ाया जा सके। सिस्टम एक उत्पादन पाइपलाइन का उपयोग करता है जो विशेष मॉडलों को दिशात्मक संपादन रिकॉर्ड उत्पन्न करने के लिए संगठित करता है, जिससे जोड़ने, हटाने, प्रतिस्थापित करने और गुण कार्यों में 1.2 मिलियन से अधिक उच्च-गुणवत्ता वाले नमूने प्राप्त होते हैं।
Alibaba Cloud ने Qwen3.8-Omni-Flash का परिचय दिया, जो एक स्वदेशी बहुआयामी एजेंटिक मॉडल है जो वास्तविक दुनिया की उत्पादकता कार्यों के लिए डिज़ाइन किया गया है और पिछले omni मॉडलों की तुलना में बहुआयमी समझ और तर्कशीलता को काफी बेहतर बनाता है।
अलिबाबा ने 5 ट्रिलियन से 10 ट्रिलियन पैरामीटर वाले एक कृत्रिम बुद्धिमत्ता मॉडल को विकसित करने की योजनाओं की घोषणा की है। इस रोडमैप के साथ, कंपनी ने अपनी बुनियादी ढांचा आवश्यकताओं का समर्थन करने के लिए डिज़ाइन किए गए एक नए कस्टम चिप को भी प्रकट किया।
अलibaba की क्वेन टीम ने Qwen-Image-2.1 जारी किया है, जो एकत्रीकृत टेक्स्ट-टू-इमेज जनरेशन और इमेज संपादन मॉडल है जो पिछले अलग-अलग चेकपॉइंट्स को एकल 7B पैरामीटर डिफ्यूजन ट्रांसफॉर्मर में समेटता है।
Qwen ने Qwen-Image-2.1 जारी किया है, जो छवि निर्माण और संपादन दोनों के लिए डिज़ाइन किया गया एक एकीकृत मॉडल है।
अलibaba क्वेन टीम ने Qwen3.8-LiveTranslate जारी किया है, जो एक अगली पीढ़ी का रियल-टाइम सिमुल्टेनस इंटर्प्रिटेशन मॉडल है जो लाइव स्पीच सुनता है और वक्ता अभी भी बोल रहा हो तभी अनुवादित टेक्स्ट और ऑडियो लौटाता है। इस रिलीज में लेटेंसी कम करने और अनुवाद गुणवत्ता को बेहतर बनाने के लिए डिज़ाइन किया गया एक नया इंटरलीव आर्किटेक्चर पेश किया गया है।
अलibaba ने एक ओपन-सोर्स चिकित्सा कृत्रिम बुद्धिमत्ता मॉडल जारी किया है जो कैंसर और लगभग 150 अन्य चिकित्सा स्थितियों का पता लगा सकता है।
Qwen3.8 Max (0902) मॉडल ने Artificial Analysis Intelligence Index में 45 का स्कोर प्राप्त किया है, जिसने चीन की लीडरबोर्ड पर शीर्ष स्थान वापस हासिल कर लिया।
TRL v1.14 ने AsyncGRPOTrainer में LoRA समर्थन पेश किया, जिससे यह एक Low-Rank Adaptation एडेप्टर को प्रशिक्षित कर सकता है और केवल उस छोटे फ़ाइल को vLLM इनफ़रेंस वर्करों पर समन्वयित कर सकता है। यह आर्किटेक्चर एक साझा Storage Bucket को फ़ाइल सिस्टम ब्रिज के रूप में उपयोग करके अलग-अलग मशीनों पर प्रशिक्षण और जनरेटिंग जॉब्स को अलग करता है, जिससे नोड्स के बीच NCCL या सीधे नेटवर्क संचार की आवश्यकता समाप्त हो जाती है।
एक अध्ययन ने "FragileTokens" का वर्णन किया है, जो ओपन-वेट भाषा मॉडलों में शब्दावली के एंट्री हैं जो अलग होने पर सफलतापूर्वक प्रतिलिपि बनाते हैं लेकिन आसपास के पाठ में शामिल होने पर त्रुटियां दिखाते हैं। शोध से पता चलता है कि साधारण अलगाव परीक्षणों द्वारा शाब्दिक पहचान की सुरक्षा सुनिश्चित नहीं होती, क्योंकि टोकन अनुक्रमों के भीतर हटाए जा सकते हैं, प्रतिस्थापित किए जा सकते हैं या काटे जा सकते हैं।
ExecCritic एक ऐसा फ्रेमवर्क पेश करता है जो स्रोत-कोड मरम्मत से परीक्षण निर्माण को अलग करता है ताकि कोडिंग एजेंट्स में गलत आत्मविश्वास को रोका जा सके। सिस्टम एक Test एजेंट और एक Repair एजेंट का उपयोग करता है, दोनों Qwen-3.5-35B-A3B द्वारा समर्थित हैं, जिन्हें प्रबलन सीखने (reinforcement learning) का उपयोग कर अलग से प्रशिक्षित किया गया है।
शोधकर्ताओं ने ExecCritic पेश किया, एक फ्रेमवर्क जो टेस्ट-सत्यापित-संशोधन स्केफोल्ड को भूमिका-विशिष्ट पुनर्बल सीखने के साथ मिलाकर कोडिंग एजेंट्स को बेहतर बनाता है। सिस्टम परीक्षण निर्माण और स्रोत-कोड मरम्मत को अलग करता है, एक Test एजेंट का उपयोग रिपॉजिटरी-नेटिव परीक्षण उत्पन्न करने के लिए और एक Repair एजेंट का उपयोग निष्पादन फीडबैक के आधार पर कोड संशोधित करने के लिए।