نشرت أنثروبيك مقالاً بحثياً بعنوان "GLM-5.3 ونشر القدرات السيبرانية المتقدمة"، يدرس كيفية استخدام النماذج مفتوحة المصدر مثل GLM-5 في الأنشطة السيبرانية الخبيثة. يبرز المقال أن هذه النماذج قد تم اعتمادها على نطاق واسع من قبل الجهات الفاعلة في التهديدات، وتعمل فعلياً كإعلان لقدراتها داخل مجتمع الأمن. يؤكد هذا التحليل على القلق المتزايد بشأن الطبيعة ذات الاستخدام المزدوج للنماذج المتقدمة للذكاء الاصطناعي وإمكانية تضخيم التهديدات السيبرانية.
ربط بحث أنثروبيك GLM-5 بنشر القدرات السيبرانية المتقدمة
Anthropic تجد أن GLM-5.3 يحقق اختطافًا كاملاً لتدفق التحكم في فرق الاختراق السيبراني
قام فريق Frontier Red Team التابع لشركة Anthropic بتقييم النموذج الصيني GLM-5.3 على 100 مهمة من معيار Binary Exploitation الداخلي ووجد أنه قادر على تطوير اختطاف كامل لتدفق التحكم في 4% من المحاولات.
Anthropic تحلل GLM-5.3 وانتشار القدرات السيبرانية المتقدمة
نشرت Anthropic مقالاً بحثياً يدرس GLM-5.3 ودورها في نشر القدرات السيبرانية المتقدمة.
تقييم نماذج الحدود العليا في لعبة أسئلة log(N) عبر ويكيبيديا
تقيّم دراسة ستة نماذج لغوية حدودية عليا في مهمة اتصال بين وكيلين، حيث يحدد مُطرح الأسئلة هدفاً من بين N فقرة من ويكيبيديا باستخدام بالضبط log2(N) من أسئلة نعم/لا. جرت التجربة على 408 لعبة عبر مجموعات وثائق تتراوح من 4 إلى 1024 فقرة، وكشفت عن تفاوتات أداء كبيرة بين النماذج المختبرة.
GLM-5.3 Flash يقترب من Claude Opus 4.8 في اختبارات البرمجة
كشفت Z.ai أن النموذج الذي تم اختباره سابقًا بشكل مجهول، ox-alpha، هو GLM-5.3-Flash، وهو نموذج Mixture of Experts (MoE) يحتوي على 320 مليار معامل و18 مليار معامل نشط.
GLM-5.3 تساوي دقة Claude Fable 5 على DeepSWE بتكلفة أقل بخمس مرات
يكشف مقارنة بين GLM-5.3 وClaude Fable 5 في معيار DeepSWE أن كلا النموذجين يحققان دقة متقاربة جداً في المحاولة الأولى (69.0% مقابل 69.7%)، لكن GLM-5.3 أكثر فعالية من حيث التكلفة وأداءً أفضل في سيناريوهات المحاولات المتعددة.