Команда Frontier Red Team компании Anthropic оценивала китайскую модель GLM-5.3 на 100 задачах из внутреннего бенчмарка Binary Exploitation и обнаружила, что она способна разрабатывать полный перехват управления потоком в 4% испытаний.

  • GLM-5.3 преуспела в 4% испытаний, тогда как Claude Mythos Preview достигла этого результата в 6%.
  • Более ранние модели, включая Claude Opus 4.6 и GLM-5.2, не преуспели ни в одной из задач.
  • Результаты указывают на то, что был преодолен значимый порог в отношении передовых киберспособностей.