Le Frontier Red Team d'Anthropic a évalué le modèle chinois GLM-5.3 sur 100 tâches d'un benchmark interne de Binary Exploitation et a découvert qu'il est capable de développer des hijacks complets du flux de contrôle dans 4% des essais.

  • GLM-5.3 a réussi dans 4% des essais, tandis que Claude Mythos Preview y est parvenu dans 6%.
  • Les modèles antérieurs, dont Claude Opus 4.6 et GLM-5.2, n'ont réussi aucune des tâches.
  • Les résultats indiquent qu'un seuil significatif a été franchi concernant les capacités cyber avancées.