GLM-5.3 a obtenu un score de 10 sur 30 (33,3 %) sur le benchmark SlopCodeBench, ex æquo avec Fable 5 et GPT-5.6 Sol dans le sous-ensemble de six problèmes.
- Sur la liste de trois problèmes et 17 points de contrôle du rapport Opus 5, GLM-5.3 a marqué 8/17 (47,1 %).
- Le benchmark nécessite de construire des outils étape par étape tout en gérant de nouvelles exigences sans casser les fonctionnalités existantes.
- Aucun AI n'a encore réussi à résoudre complètement le benchmark.
- La difficulté semble corrélée au nombre de tokens de sortie requis pour résoudre les problèmes.
Les résultats indiquent la performance compétitive de GLM-5.3 par rapport aux autres modèles leaders dans des tâches de codage complexes et évolutives.