O GLM-5.3 obteve uma pontuação de 10 de 30 (33,3%) na benchmark SlopCodeBench, empatando com o Fable 5 e o GPT-5.6 Sol no subconjunto de seis problemas.
- Na lista de três problemas e 17 checkpoints do relatório Opus 5, o GLM-5.3 marcou 8/17 (47,1%).
- A benchmark exige construir ferramentas passo a passo enquanto lida com novos requisitos sem quebrar a funcionalidade existente.
- Nenhuma IA ainda conseguiu resolver completamente a benchmark.
- A dificuldade parece estar correlacionada com a saída de tokens necessária para resolver os problemas.
Os resultados indicam o desempenho competitivo do GLM-5.3 em comparação com outros modelos líderes em tarefas de codificação complexas e em evolução.