قام فريق Frontier Red Team التابع لشركة Anthropic بتقييم النموذج الصيني GLM-5.3 على 100 مهمة من معيار Binary Exploitation الداخلي ووجد أنه قادر على تطوير اختطاف كامل لتدفق التحكم في 4% من المحاولات.
- نجح GLM-5.3 في 4% من المحاولات، بينما حقق Claude Mythos Preview هذا بنسبة 6%.
- لم تنجح النماذج السابقة، بما في ذلك Claude Opus 4.6 وGLM-5.2، في أي من المهام.
- تشير النتائج إلى أنه تم تجاوز عتبة ذات معنى فيما يتعلق بالقدرة السيبرانية المتقدمة.