Le Frontier Red Team d'Anthropic a évalué le modèle chinois GLM-5.3 sur 100 tâches d'un benchmark interne de Binary Exploitation et a découvert qu'il est capable de développer des hijacks complets du flux de contrôle dans 4% des essais.
- GLM-5.3 a réussi dans 4% des essais, tandis que Claude Mythos Preview y est parvenu dans 6%.
- Les modèles antérieurs, dont Claude Opus 4.6 et GLM-5.2, n'ont réussi aucune des tâches.
- Les résultats indiquent qu'un seuil significatif a été franchi concernant les capacités cyber avancées.