قام فريق Frontier Red Team التابع لشركة Anthropic بتقييم النموذج الصيني GLM-5.3 على 100 مهمة من معيار Binary Exploitation الداخلي ووجد أنه قادر على تطوير اختطاف كامل لتدفق التحكم في 4% من المحاولات.

  • نجح GLM-5.3 في 4% من المحاولات، بينما حقق Claude Mythos Preview هذا بنسبة 6%.
  • لم تنجح النماذج السابقة، بما في ذلك Claude Opus 4.6 وGLM-5.2، في أي من المهام.
  • تشير النتائج إلى أنه تم تجاوز عتبة ذات معنى فيما يتعلق بالقدرة السيبرانية المتقدمة.