El Frontier Red Team de Anthropic evaluó el modelo chino GLM-5.3 en 100 tareas de un benchmark interno de Binary Exploitation y descubrió que es capaz de desarrollar secuestros completos del flujo de control en el 4% de los ensayos.

  • GLM-5.3 tuvo éxito en el 4% de los ensayos, mientras que Claude Mythos Preview logró esto en el 6%.
  • Modelos anteriores, incluidos Claude Opus 4.6 y GLM-5.2, no tuvieron éxito en ninguna de las tareas.
  • Los resultados indican que se ha cruzado un umbral significativo con respecto a las capacidades cibernéticas avanzadas.