लैब · Zhipu AI
media Interconnects · 1 घंटे पहले लाइव

Z.ai ने GLM-5.3 को विस्तारित पोस्ट-ट्रेनिंग के साथ जारी किया

Z.ai ने GLM-5.3 की घोषणा की, एक नया मॉडल जो अपने GLM-5.2 बेस मॉडल के पोस्ट-ट्रेनिंग को बढ़ाकर एजेंटिक कोडिंग बेंचमार्क्स पर फ्रंटियर प्रदर्शन हासिल करता है। ~750B पैरामीटर वाला मॉडल वर्तमान में Kimi K3 से आगे है और विभिन्न बेंचमार्क्स पर Claude Fable 5 और GPT-5.6-Sol के बराबर या उससे अधिक है।

media MarkTechPost · 11 घंटे पहले · 2 बार देखा गया

Z.ai ने पोस्ट-ट्रेनिंग के माध्यम से कोडिंग और साइबरसुरक्षा में सुधार के साथ GLM-5.3 जारी किया

Z.ai ने अपने 743B पैरामीटर मॉडल का अपडेट GLM-5.3 जारी किया है, जो बेस मॉडल के पुनः प्रशिक्षण के बजाय स्केल्ड पोस्ट-ट्रेनिंग के माध्यम से प्रदर्शन में वृद्धि हासिल करता है। रिलीज़ वर्तमान में Z.ai API, GLM कोडिंग प्लान और ZCode के माध्यम से उपलब्ध है, और सुरक्षा मूल्यांकन के बाद लगभग दो सप्ताह में पब्लिक वेट्स की रिलीज़ की योजना है।

arxiv arXiv cs.LG · 2 दिन पहले HealthBench · 51.9% · 5 बार देखा गया

HealthBench पर VITA क्लिनिकल RAG सिस्टम फ्रंटियर LLMs के बराबर या बेहतर है

कम और मध्यम आय वाले सेटिंग्स के लिए डिज़ाइन किया गया एक उद्देश्य-निर्मित पुनर्प्राप्ति-वर्धित जनरेशन (RAG) सिस्टम जिसका नाम VITA है, को HealthBench बेंचमार्क पर सामान्य-उद्देश्य वाले बड़े भाषा मॉडल्स के खिलाफ आंकलन किया गया। GPT-4.1 जज द्वारा स्कोर किए गए 4,023 प्रश्नों पर, VITA ने संभावित रूब्रिक अंकों में से 51.9% के साथ पहले स्थान पर रहे, जिसमें GPT-5.4, o4-mini, Gemini 3.1 Pro और Claude Sonnet 4.6 को पीछे छोड़ दिया।

arxiv arXiv cs.LG · 4 दिन पहले · 2 बार देखा गया

Macaron-V1 ने Mixture-of-LoRA के साथ निरंतर सीखने के लिए खुला एजेंट-मॉडल परिवार पेश किया

Macaron-V1 एक खुला एजेंट-मॉडल परिवार है जो अनुभवजन्य बुद्धिमत्ता के लिए डिज़ाइन किया गया है, जो वास्तविक पर्यावरण से सीखने और तैनाती के बाद भी सीखते रहने में सक्षम बनाता है। सिस्टम दो लक्ष्यों पर केंद्रित है: मॉडल-हार्नेस जोड़ों के पुनरावर्ती सुधार के माध्यम से अनुकूलन और प्रति उपयोगकर्ता पाले विशेषज्ञ LoRA एडेप्टर्स का चयन करने वाली Mixture-of-LoRA (MoL) आर्किटेक्चर के माध्यम से सहयोग।

arxiv arXiv cs.CL · 4 दिन पहले · 10 बार देखा गया

Macaron-V1 ने Mixture-of-LoRA के साथ निरंतर सीखने के लिए खुला एजेंट-मॉडल परिवार पेश किया

Macaron-V1 एक खुला एजेंट-मॉडल परिवार है जो अनुभवजन्य बुद्धिमत्ता के लिए डिज़ाइन किया गया है, जिससे सिस्टम वास्तविक दुनिया के अनुभवों से सीख सकते हैं और तैनाती के बाद भी सुधार जारी रख सकते हैं। आर्किटेक्चर दो लक्ष्यों पर केंद्रित है: मॉडल-हार्नेस जोड़ों की पुनरावृत्त स्वयं-सुधार के माध्यम से अनुकूलन, और उपयोगकर्ता चरण के प्रति विशेषज्ञ एडेप्टर्स का चयन करने वाले Mixture-of-LoRA (MoL) सिस्टम के सहयोग के माध्यम से।

media r/LocalLLaMA · 12 दिन पहले · 16 बार देखा गया

Zhipu GLM-5.3 की आधिकारिक दस्तावेज़ ऑनलाइन संक्षिप्त रूप से प्रकट हुई

Zhipu के अगले GLM-5.3 मॉडल की दस्तावेज़ सामने आई और कुछ ही सेकंड में हटा दी गई। पेज गायब होने से पहले Bing द्वारा इंडेक्स किए गए थे।

media r/LocalLLaMA · 15 दिन पहले Artificial Analysis Intelligence Index · 50.0% · 18 बार देखा गया

ArtificialAnalysis इंडेक्स में DeepSeek V4-Flash ने 50 हासिल किए

नया DeepSeek V4-Flash मॉडल ArtificialAnalysis इंडेक्स पर 50 अंक प्राप्त करने में सफल रहा है। इस परिणाम के आधार पर यह GLM-5.2 और GPT-5.6 Luna से केवल एक अंक नीचे है।

arxiv arXiv cs.CL · 15 दिन पहले · 3 बार देखा गया

OSReward ने क्रॉस-प्लेटफ़ॉर्म कंप्यूटर-यूज़ रिवर्ड मॉडल्स के लिए मानकीकृत मूल्यांकन पेश किया

शोधकर्ताओं ने OSReward का परिचय दिया, एक यथार्थवादी बेंचमार्क जो कंप्यूटर-यूज़िंग एजेंट ट्रेजेक्टरीज़ के लिए जज के रूप में कार्य करने वाले विज़न-लैंग्वेज मॉडल्स (VLMs) की विश्वसनीयता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। अध्ययन से पता चलता है कि भले ही राज्य-दर-श्रेणी VLMs व्यवस्थित कोमलता पूर्वाग्रह से ग्रस्त हैं और स्केल के लिए अक्सर बहुत महंगे हैं, जबकि सस्ते ओपन मॉडल खराब प्रदर्शन करते हैं।

media TLDR AI · 16 दिन पहले · 34 बार देखा गया

xAI ने Build Mode लॉन्च किया; शोधकर्ताओं ने AI धीमी करने की संधि का आह्वान किया

xAI ने SuperGrok Heavy सब्सक्राइबर्स के लिए "Build Mode" लॉन्च किया है, जिससे उपयोगकर्ता सेटअप के बिना चैट से सीधे वेबसाइटें, ऐप्स, गेम्स और डैशबोर्ड जनरेट, संपादित, पूर्वावलोकन और प्रकाशित कर सकते हैं। इसी बीच, फ्रंटियर एआई कंपनियों के एक हजार से अधिक कर्मचारियों ने एक बयान पर हस्ताक्षर किए हैं जिसमें अमेरिकी सरकार से स्वचालित AI विकास की सीमा को जानबूझकर नियंत्रित करने के लिए उपकरण विकसित करने के अंतर्राष्ट्रीय प्रयास का समर्थन करने का अनुरोध किया गया है।

github llama.cpp · 17 दिन पहले · 2 बार देखा गया

GLM-5.2 के लिए NextN/MTP अनुमानित डिकोडिंग समर्थन जोड़ता है llama.cpp b10174

llama.cpp परियोजना ने GLM_DSA (GLM-5.2) मॉडल आर्किटेक्चर के लिए NextN/MTP अनुमानित डिकोडिंग समर्थन पेश करते हुए बिल्ड b10174 जारी किया।

media AI News (smol.ai) · 17 दिन पहले · 2 बार देखा गया

Moonshot ने Kimi K3 ओपन-वेट मॉडल और इंफ्रास्ट्रक्चर जारी किया

Moonshot ने Kimi K3 के लिए पूर्ण विवरण, वेट्स और सहायक इंफ्रास्ट्रक्चर जारी किए हैं, जो 2.8T-पैरामीटर Mixture-of-Experts मॉडल है जिसमें प्रति टोकन लगभग 104B सक्रिय पैरामीटर हैं। रिलीज में इसके हाइब्रिड लॉन्ग-कंटैक्स्ट स्टैक और MoonEP, FlashKDA, और AgentEnv जैसे नए टूल्स का विवरण देने वाले तकनीकी रिपोर्ट शामिल हैं।

arxiv arXiv cs.CL · 18 दिन पहले · 3 बार देखा गया

PIVOT क्वेरी समूहों के बीच प्रीफिक्स स्कैन साझा करके टोकन-स्तर की विरल एटेंशन को तेज़ करता है

PIVOT (Proxy Indexing Via One full-prefix Traversal) एक ट्रेनिंग-फ्री, ड्रॉप-इन प्रतिस्थापन है DeepSeek Sparse Attention (DSA) इंडेक्सर के लिए जो निकटवर्ती क्वेरियों के समूह में एक प्रीफिक्स स्कैन साझा करके कंप्यूटेशनल अतिरेक को कम करता है। हर क्वेरी के लिए प्रत्येक पूर्ववर्ती टोकन को अलग-अलग स्कोर करने के बजाय, PIVOT समूह को एक सिंगल प्रॉक्सी क्वेरी में एग्रीगेट करता है ताकि एक उम्मीदवार सेट प्राप्त किया जा सके, जिससे हर क्वेरी के लिए टॉप-k टोकन चुने जाते हैं।

arxiv arXiv cs.CL · 18 दिन पहले · 2 बार देखा गया

Zing फ्रेमवर्क SoMBench बेंचमार्क और Actio ग्रौंडिंग के माध्यम से LLM सामाजिक बुद्धिमत्ता को सुधारता है

रिपोर्ट में Zing का परिचय दिया गया है, एक एकीकृत फ्रेमवर्क जिसे बड़े भाषा मॉडलों की सामाजिक बुद्धिमत्ता को मापने, आंतरिक करने और ग्रौंडिंग के द्वारा बढ़ाने के लिए डिज़ाइन किया गया है। लेखकों ने SoMBench प्रस्तुत किया है, एक मनोविज्ञान-आधारित बेंचमार्क जो 17 द्वितीयक आयामों और 3,481 विशेषज्ञ-सत्यापित उदाहरणों को कवर करता है, जो दर्शाता है कि वर्तमान LLMs में सुधार के लिए महत्वपूर्ण स्थान है और कोई भी मॉडल लगभग शीर्ष प्रदर्शन तक नहीं पहुँचा।

media MarkTechPost · 27 दिन पहले SWE-bench Verified · 80.6% · 24 बार देखा गया

बेंचमार्क, लाइसेंस और सर्विंग लागत पर Kimi K3, DeepSeek V4 Pro और GLM-5.2 की तुलना

तीन ओपन-वेट स्पर्स मिक्स्चर-ऑफ-एक्सपर्ट्स मॉडल्स—Moonshot AI का Kimi K3, DeepSeek V4 Pro, और Zhipu AI का GLM-5.2—की तुलना लंबे समय तक चलने वाले कोडिंग और एजेंट वर्कलोड के लिए उनकी क्षमताओं, लाइसेंस शर्तों और सर्विंग लागत के आधार पर की गई है।