O GLM-5.3 obteve uma pontuação de 10 de 30 (33,3%) na benchmark SlopCodeBench, empatando com o Fable 5 e o GPT-5.6 Sol no subconjunto de seis problemas.

  • Na lista de três problemas e 17 checkpoints do relatório Opus 5, o GLM-5.3 marcou 8/17 (47,1%).
  • A benchmark exige construir ferramentas passo a passo enquanto lida com novos requisitos sem quebrar a funcionalidade existente.
  • Nenhuma IA ainda conseguiu resolver completamente a benchmark.
  • A dificuldade parece estar correlacionada com a saída de tokens necessária para resolver os problemas.

Os resultados indicam o desempenho competitivo do GLM-5.3 em comparação com outros modelos líderes em tarefas de codificação complexas e em evolução.