Un análisis comparativo de GLM-5.3 y GPT-5.6 Sol en el benchmark DeepSWE revela que una estrategia de enrutamiento en cascada supera a cualquiera de los modelos utilizados de forma aislada. Al ejecutar primero GLM-5.3 y escalar a GPT-5.6 Sol solo cuando las pruebas fallan, el sistema resuelve el 85,9 % de las tareas a $6,61 por tarea.

  • GLM-5.3 cuesta $3,99 por rollout en comparación con los $8,37 de Sol, lo que lo hace 2,1 veces más económico y produce 17 tareas resueltas por cada $100 frente a las 9 de Sol.
  • GPT-5.6 Sol lidera en precisión de un solo intento (72,7 % pass@1) y fiabilidad (61 tareas resueltas cuatro de cuatro), mientras que GLM-5.3 empató en pass@2 y lideró en pass@4 (87,6 %).
  • Los modelos divergen significativamente con una correlación por tarea de 0,43, cubriendo 106 de las 113 tareas entre ambos, lo que permite la cascada efectiva.
  • GLM-5.3 presenta modos de fallo más limpios, rompiendo pruebas existentes solo en el 11 % de los fallos en comparación con el 20 % de Sol, reduciendo la necesidad de un control de regresión pesado.

Este enfoque aprovecha GLM-5.3 como una capa frontal de menor costo y Sol como una escalación controlada por verificador, logrando una cobertura mayor que solo Sol mientras se mantiene más económico que un único rollout de Sol.