Une analyse comparative de GLM-5.3 et GPT-5.6 Sol sur le benchmark DeepSWE révèle qu'une stratégie d'acheminement en cascade surpasse chaque modèle utilisé isolément. En exécutant GLM-5.3 en premier et en escaladant vers GPT-5.6 Sol uniquement lorsque les tests échouent, le système résout 85,9 % des tâches à 6,61 $ par tâche.
- GLM-5.3 coûte 3,99 $ par rollout contre 8,37 $ pour Sol, ce qui le rend 2,1 fois moins cher et permet de résoudre 17 tâches pour 100 $ contre 9 pour Sol.
- GPT-5.6 Sol domine en précision en un seul essai (pass@1 à 72,7 %) et en fiabilité (61 tâches résolues quatre fois sur quatre), tandis que GLM-5.3 est égalisé au pass@2 et mène au pass@4 (87,6 %).
- Les modèles divergent significativement avec une corrélation de 0,43 par tâche, couvrant 106 des 113 tâches entre eux, ce qui rend la cascade efficace.
- GLM-5.3 présente des modes d'échec plus propres, cassant les tests existants dans seulement 11 % des échecs contre 20 % pour Sol, réduisant le besoin de verrouillage de régression lourd.
Cette approche exploite GLM-5.3 comme interface avant à moindre coût et Sol comme escaladement verrouillé par vérificateur, atteignant une couverture supérieure à celle de Sol seul tout en restant moins cher qu'un rollout unique de Sol.