लैब · Zhipu AI
arxiv arXiv cs.AI · 16 घंटे पहले · 1 बार देखा गया

EviRover एक बार की झलक से परे एजेंटिक दृश्यिक अनुभव को मजबूत करता है

लेखकों ने EviRover का परिचय दिया, जो पहला दृश्यिक अनुभव एजेंट है जिसे स्पष्ट रूप से एक बार की भविष्यवाणी पर निर्भर करने के बजाय इंटरैक्शन के माध्यम से दृश्यिक प्रश्नों को हल करने के लिए प्रशिक्षित किया गया है। इस सेटिंग के लिए डेटा की कमी को दूर करने के लिए, उन्होंने दो समर्पित डेटा जनरेशन पाइपलाइन डिज़ाइन किए जो EviRover-SFT-5K और EviRover-RL-12K देते हैं, साथ ही EviLens, एक मानव-सत्यापित बेंचमार्क जिसमें 688 उदाहरण हैं।

github llama.cpp · 1 दिन पहले · 7 बार देखा गया

llama.cpp ने k-pool और MTP फिक्स के साथ GLM-5.3-Flash समर्थन जोड़ा

llama.cpp प्रोजेक्ट ने GLM-5.3-Flash (GLM5-Next) मॉडल आर्किटेक्चर के लिए प्रारंभिक समर्थन जोड़ा है, जिसमें हाइब्रिड-इंडेक्स मेमोरी में माइग्रेशन और शुरुआती मल्टी-टोकन प्रेडिक्शन (MTP) क्षमताएं शामिल हैं।

blog Simon Willison · 2 दिन पहले · 4 बार देखा गया

Anthropic को पता चला कि GLM-5.3 साइबर रेड टीमिंग में पूर्ण कंट्रोल फ्लो हाइजैक प्राप्त करता है

Anthropic के Frontier Red Team ने आंतरिक Binary Exploitation बेंचमार्क से 100 कार्यों पर चीनी मॉडल GLM-5.3 का मूल्यांकन किया और पाया कि यह 4% प्रयासों में पूर्ण कंट्रोल फ्लो हाइजैक विकसित करने में सक्षम है।

media r/LocalLLaMA · 2 दिन पहले · 1 बार देखा गया

Anthropic शोध ने GLM-5 को उन्नत साइबर क्षमताओं के प्रसार से जोड़ा

Anthropic ने "GLM-5.3 और उन्नत साइबर क्षमताओं का प्रसार" शीर्षक से एक शोध लेख प्रकाशित किया, जिसमें GLM-5 जैसे ओपन-सोर्स मॉडलों का उपयोग दुर्भावनापूर्ण साइबर गतिविधियों में कैसे किया जाता है, इसका विश्लेषण किया गया है। लेख में उजागर किया गया है कि ये मॉडल खतरे के कारकों द्वारा व्यापक रूप से अपनाए गए हैं, जो सुरक्षा समुदाय के भीतर अपनी क्षमताओं के लिए एक विज्ञापन के रूप में कार्य कर रहे हैं। इस विश्लेषण ने उन्नत AI मॉडलों की द्वि-उपयोग प्रकृति और उनके साइबर खतरों को बढ़ाने की क्षमता के संबंध में बढ़ती चिंता को रेखांकित किया है।

media r/LocalLLaMA · 2 दिन पहले · 16 बार देखा गया

Anthropic GLM-5.3 और उन्नत साइबर क्षमताओं के प्रसार का विश्लेषण करता है

Anthropic ने GLM-5.3 और उन्नत साइबर क्षमताओं के प्रसार में इसके भूमिका का परीक्षण करने वाले एक शोध लेख को प्रकाशित किया है।

arxiv arXiv cs.CL · 3 दिन पहले · 1 बार देखा गया

अध्ययन से बहु-चरण LLM दूषण में ज्ञान नीति का विचलन सामने आया

"बहु-चरण LLM दूषण में ज्ञान नीति का विचलन: एक प्रोटोकॉल-ग्रेडिएंट जांच" शीर्षक का एक अध्ययन इस बात का मूल्यांकन करता है कि बड़े भाषा मॉडल संवाद इतिहास में डाले गए झूठे पूर्वधारणाओं को कैसे संभालते हैं, जिसे सत्र-स्तर दूषण कहा जाता है। शोधकर्ताओं ने तापमान शून्य पर 22,500 चरणों का उपयोग करते हुए GPT-5.4 Mini, Gemini-3.1 Flash-Lite, और GLM-4.5-Air का दस ज्ञान क्षेत्रों में परीक्षण किया।

arxiv arXiv cs.CL · 9 दिन पहले · 19 बार देखा गया

TelecomGPT-R1: विविध टेलीकॉम कार्यों में तर्क के लिए एकीकृत पोस्ट-ट्रेनिंग

शोधकर्ताओं ने TelecomGPT-R1 का परिचय दिया है, जो एक खुला-स्रोत एकीकृत टेलीकॉम तर्क मॉडल परिवार है, जो मानकों, कॉन्फ़िगरेशन और लॉग पर तर्क करके इंजीनियरिंग कार्यों को स्वचालित करने के लिए डिज़ाइन किया गया है। यह मॉडल प्रोटोकॉल, ज्ञान, मॉडलिंग और दोष अक्षों को कवर करने वाले एक संरचित दृष्टिकोण के माध्यम से मौजूदा सामान्य-उद्देश्य और विशेष LLMs की सीमाओं को दूर करता है।

arxiv arXiv cs.LG · 10 दिन पहले HealthBench · 50.1% · 13 बार देखा गया

Fathom-Vaidya रूब्रिक-आधारित पुरस्कारों के साथ चिकित्सा तर्क को बेहतर बनाता है

लेखकों ने Fathom-Vaidya का परिचय दिया, जो 30B पैरामीटर वाला एक मॉडल है जो संज्ञानात्मक और क्लिनिकल हेल्थकेयर तर्क को बढ़ाने के लिए सिंथेटिक डेटा और रूब्रिक-आधारित पुनर्बल सीखने का उपयोग करता है। प्रशिक्षण ढांचा पहले निदान के लिए MedBullets से प्राप्त प्रश्नों पर नियम-निर्देशित RL लागू करता है, फिर इंटरैक्टिव क्लिनिकल कार्यों के लिए बहु-आयामी रूब्रिक्स के साथ 5.3k सिंथेटिक मल्टी-टर्न परिदृश्यों का उपयोग करता है।

media r/LocalLLaMA · 13 दिन पहले · 28 बार देखा गया

ZCode पूरी Git इतिहास और वर्कस्पेस को चुपचाप Aliyun OSS पर अपलोड करता है

Zhipu के आधिकारिक AI कोडिंग डेस्कटॉप ऐप, ZCode, लॉग इन होने पर उपयोगकर्ताओं के पूर्ण वर्कस्पेस को चुपचाप पैकेज कर और अपलोड करने पाया गया है। इस प्रक्रिया में डेटा को एन्क्रिप्ट करना और इसे सीधे Aliyun OSS को भेजना शामिल है।

media r/LocalLLaMA · 14 दिन पहले · 16 बार देखा गया

GLM ने अपने नए ब्लॉग पोस्ट में अपनी इनफ्रेंस इन्फ्रास्ट्रक्चर का विस्तार से वर्णन किया है

GLM टीम ने z.ai पर एक ब्लॉग पोस्ट प्रकाशित की है जिसमें उनकी इनफ्रेंस इन्फ्रास्ट्रक्चर की आर्किटेक्चर और डिज़ाइन का विस्तार से वर्णन किया गया है।

arxiv arXiv cs.CL · 15 दिन पहले · 24 बार देखा गया

विकिपीडिया पर log(N)-प्रश्न गेम पर सीमांत मॉडल का मूल्यांकन

एक अध्ययन में छह सीमांत भाषा मॉडल का दो-एजेंट संचार कार्य पर मूल्यांकन किया गया, जहां एक प्रश्नकर्ता log2(N) हां/नहीं प्रश्नों का उपयोग करके N विकिपीडिया अनुच्छेदों से एक लक्ष्य की पहचान करता है। 4 से 1024 अनुच्छेदों वाले दस्तावेज़ सेट पर 408 खेल चलाए गए, जिसमें परीक्षण किए गए मॉडल के बीच महत्वपूर्ण प्रदर्शन अंतर सामने आया।

media r/LocalLLaMA · 17 दिन पहले · 16 बार देखा गया

Base-10 का चार्ली ओ'नील कहता है कि Kimi और GLM, Opus 5 से बेहतर हैं

Dwarkesh Patel के साथ एक हालिया एपिसोड में Base-10 के चार्ली ओ'नील ने चर्चा की कि Kimi और GLM मॉडल "लगभग वस्तुनिष्ठ रूप से" Opus 5 से बेहतर क्यों हैं।

media r/LocalLLaMA · 18 दिन पहले · 25 बार देखा गया

वैज्ञानिक बुद्धिमत्ता के लिए InternLM ने वैज्ञानिक इंटर-एस2-397B बहुआयामी मॉडल जारी किया

इंटरएलएम ने वैज्ञानिक इंटर-एस2-397B का परिचय दिया है, जो वैज्ञानिक बुद्धिमत्ता और दीर्घकालिक एजेंट्स के लिए डिज़ाइन किया गया एक 397-अरब पैरामीटर वाला बहुआयामी फाउंडेशन मॉडल है। यह मॉडल सामान्य तर्कशक्ति और एजेंटिक क्षमताओं को बढ़ाने के लिए प्री-ट्रेनिंग, रीइन्फोर्समेंट-लर्निंग टास्क कवरेज और इंटरैक्टिव एजेंट वातावरण में स्केल करता है।

arxiv arXiv cs.CL · 22 दिन पहले · 33 बार देखा गया

GLM-5.3-Flash पर एकदिशीय हमला MoE मॉडल्स में सुरक्षा एलाइनमेंट की नाजुकता को उजागर करता है

शोधकर्ताओं ने दिखाया कि दिशात्मक अबलेशन, जो वेट्स से एक दिशा को प्रोजेक्ट करके इनकार को हटाने वाला एक व्हाइट-बॉक्स हमला है, GLM-5.3-Flash जैसे फ्रंटियर मिक्चर-ऑफ-एक्सपर्ट्स (MoE) मॉडल्स पर प्रभावी बना हुआ है। अध्ययन दर्शाता है कि जबकि हमला आर्किटेक्चर के बावजूद टिक जाता है, इसके प्रभाव एटेंशन, डेनस और रूटेड-एक्सपर्ट राइटर्स में फैले हुए हैं, न कि किसी एक स्थान पर केंद्रित।