Anthropic ने "GLM-5.3 और उन्नत साइबर क्षमताओं का प्रसार" शीर्षक से एक शोध लेख प्रकाशित किया, जिसमें GLM-5 जैसे ओपन-सोर्स मॉडलों का उपयोग दुर्भावनापूर्ण साइबर गतिविधियों में कैसे किया जाता है, इसका विश्लेषण किया गया है। लेख में उजागर किया गया है कि ये मॉडल खतरे के कारकों द्वारा व्यापक रूप से अपनाए गए हैं, जो सुरक्षा समुदाय के भीतर अपनी क्षमताओं के लिए एक विज्ञापन के रूप में कार्य कर रहे हैं। इस विश्लेषण ने उन्नत AI मॉडलों की द्वि-उपयोग प्रकृति और उनके साइबर खतरों को बढ़ाने की क्षमता के संबंध में बढ़ती चिंता को रेखांकित किया है।
Anthropic शोध ने GLM-5 को उन्नत साइबर क्षमताओं के प्रसार से जोड़ा
Anthropic को पता चला कि GLM-5.3 साइबर रेड टीमिंग में पूर्ण कंट्रोल फ्लो हाइजैक प्राप्त करता है
Anthropic के Frontier Red Team ने आंतरिक Binary Exploitation बेंचमार्क से 100 कार्यों पर चीनी मॉडल GLM-5.3 का मूल्यांकन किया और पाया कि यह 4% प्रयासों में पूर्ण कंट्रोल फ्लो हाइजैक विकसित करने में सक्षम है।
Anthropic GLM-5.3 और उन्नत साइबर क्षमताओं के प्रसार का विश्लेषण करता है
Anthropic ने GLM-5.3 और उन्नत साइबर क्षमताओं के प्रसार में इसके भूमिका का परीक्षण करने वाले एक शोध लेख को प्रकाशित किया है।
विकिपीडिया पर log(N)-प्रश्न गेम पर सीमांत मॉडल का मूल्यांकन
एक अध्ययन में छह सीमांत भाषा मॉडल का दो-एजेंट संचार कार्य पर मूल्यांकन किया गया, जहां एक प्रश्नकर्ता log2(N) हां/नहीं प्रश्नों का उपयोग करके N विकिपीडिया अनुच्छेदों से एक लक्ष्य की पहचान करता है। 4 से 1024 अनुच्छेदों वाले दस्तावेज़ सेट पर 408 खेल चलाए गए, जिसमें परीक्षण किए गए मॉडल के बीच महत्वपूर्ण प्रदर्शन अंतर सामने आया।
GLM-5.3 Flash कोडिंग बेंचमार्क पर Claude Opus 4.8 के करीब पहुंच रहा है
Z.ai ने बताया कि पहले अनाम रूप से परीक्षण किए गए मॉडल ox-alpha GLM-5.3-Flash है, जो 320B पैरामीटर वाले Mixture of Experts (MoE) मॉडल है जिसमें 18B सक्रिय पैरामीटर हैं।
GLM-5.3 DeepSWE पर Claude Fable 5 की सटीकता को पांचवें खर्च पर बराबर लाता है
DeepSWE बेंचमार्क पर GLM-5.3 और Claude Fable 5 की तुलना से पता चलता है कि जबकि दोनों मॉडल्स लगभग समान पहली-शॉट सटीकता प्राप्त करते हैं (69.0% बनाम 69.7%), GLM-5.3 काफी अधिक लागत-प्रभावी है और बहु-प्रयास परिदृश्यों में बेहतर प्रदर्शन करता है।