Frontier Red Team Anthropic mengevaluasi model Tiongkok GLM-5.3 pada 100 tugas dari benchmark Binary Exploitation internal dan menemukan bahwa model tersebut mampu mengembangkan hijack aliran kontrol penuh dalam 4% percobaan.

  • GLM-5.3 berhasil dalam 4% percobaan, sementara Claude Mythos Preview mencapai hal ini dalam 6%.
  • Model-model sebelumnya, termasuk Claude Opus 4.6 dan GLM-5.2, tidak berhasil dalam tugas mana pun.
  • Hasil-hasil tersebut menunjukkan bahwa ambang batas yang bermakna telah terlampaui terkait kemampuan siber tingkat lanjut.