O Frontier Red Team da Anthropic avaliou o modelo chinês GLM-5.3 em 100 tarefas de um benchmark interno de Binary Exploitation e descobriu que ele é capaz de desenvolver sequestros completos de fluxo de controle em 4% dos ensaios.

  • GLM-5.3 teve sucesso em 4% dos ensaios, enquanto Claude Mythos Preview alcançou isso em 6%.
  • Modelos anteriores, incluindo Claude Opus 4.6 e GLM-5.2, não tiveram sucesso em nenhuma das tarefas.
  • Os resultados indicam que um limiar significativo foi ultrapassado em relação às capacidades cibernéticas avançadas.