Una comparación entre GLM-5.3 y Claude Fable 5 en el benchmark DeepSWE revela que, aunque ambos modelos logran una precisión de primer intento casi idéntica (69,0 % frente a 69,7 %), GLM-5.3 es significativamente más rentable y tiene un mejor desempeño en escenarios de múltiples intentos.
- GLM-5.3 cuesta $3,99 por rollout frente a los $21,63 de Fable 5, una brecha de precio de 5,4x que resulta en 17 resoluciones por cada $100 frente a las 3 de Fable.
- En métricas de múltiples intentos, GLM-5.3 lidera con pass@2 al 81,1 % (frente al 77,1 %) y pass@4 al 87,6 % (frente al 84,1 %), demostrando un techo más alto.
- Los modelos son casi sustitutos con una correlación por tarea de 0,65, lo que significa que ejecutar ambos añade poca diversidad en la cobertura.
- GLM-5.3 gana en cinco dominios de tareas, incluida la concurrencia y la durabilidad, mientras que Fable 5 lidera solo en Rust (85 % frente a 70 %) y en trabajos con alta carga de serialización.
El análisis concluye que GLM-5.3 debería ser el modelo predeterminado para la mayoría de las tareas de ingeniería de software debido a su menor costo y cobertura más amplia, reservando Fable 5 como una vía de escalación costosa específicamente para trabajo crítico en Rust o serialización.