GLM-5.3 logró una puntuación de 10 de 30 (33,3%) en la prueba de referencia SlopCodeBench, empatando con Fable 5 y GPT-5.6 Sol en el subconjunto de seis problemas.
- En la lista de tres problemas y 17 puntos de control del informe Opus 5, GLM-5.3 obtuvo 8/17 (47,1%).
- La prueba requiere construir herramientas paso a paso mientras se manejan nuevos requisitos sin romper la funcionalidad existente.
- Ninguna IA ha logrado resolver completamente la prueba hasta ahora.
- La dificultad parece estar correlacionada con los tokens de salida requeridos para resolver los problemas.
Los resultados indican el rendimiento competitivo de GLM-5.3 frente a otros modelos líderes en tareas de codificación complejas y evolutivas.