GLM-5.3 logró una puntuación de 10 de 30 (33,3%) en la prueba de referencia SlopCodeBench, empatando con Fable 5 y GPT-5.6 Sol en el subconjunto de seis problemas.

  • En la lista de tres problemas y 17 puntos de control del informe Opus 5, GLM-5.3 obtuvo 8/17 (47,1%).
  • La prueba requiere construir herramientas paso a paso mientras se manejan nuevos requisitos sin romper la funcionalidad existente.
  • Ninguna IA ha logrado resolver completamente la prueba hasta ahora.
  • La dificultad parece estar correlacionada con los tokens de salida requeridos para resolver los problemas.

Los resultados indican el rendimiento competitivo de GLM-5.3 frente a otros modelos líderes en tareas de codificación complejas y evolutivas.