Anthropic의 Frontier Red Team은 내부 Binary Exploitation 벤치마크의 100개 작업에서 중국산 모델 GLM-5.3을 평가했으며, 시도의 4%에서 완전한 제어 흐름 하이재킹을 개발할 수 있음을 발견했습니다.

  • GLM-5.3은 시도의 4%에서 성공했으며, Claude Mythos Preview는 6%에서 이를 달성했습니다.
  • Claude Opus 4.6 및 GLM-5.2를 포함한 이전 모델은 어떤 작업에서도 성공하지 못했습니다.
  • 이 결과는 고급 사이버 능력과 관련하여 의미 있는 임계값을 넘었음을 나타냅니다.