Uma análise comparativa do GLM-5.3 e do GPT-5.6 Sol no benchmark DeepSWE revela que uma estratégia de roteamento em cascata supera o uso isolado de qualquer um dos modelos. Ao executar o GLM-5.3 primeiro e escalar para o GPT-5.6 Sol apenas quando os testes falham, o sistema resolve 85,9% das tarefas a US$ 6,61 por tarefa.
- O GLM-5.3 custa US$ 3,99 por rollout em comparação com os US$ 8,37 do Sol, sendo 2,1x mais barato e gerando 17 tarefas resolvidas por cada US$ 100, contra 9 do Sol.
- O GPT-5.6 Sol lidera em precisão de tiro único (pass@1 de 72,7%) e confiabilidade (61 tarefas resolvidas quatro vezes em quatro), enquanto o GLM-5.3 empata no pass@2 e lidera no pass@4 (87,6%).
- Os modelos divergem significativamente com uma correlação de 0,43 por tarefa, cobrindo 106 das 113 tarefas entre eles, o que permite a cascata eficaz.
- O GLM-5.3 apresenta modos de falha mais limpos, quebrando testes existentes em apenas 11% das falhas em comparação com os 20% do Sol, reduzindo a necessidade de um gating de regressão pesado.
Essa abordagem aproveita o GLM-5.3 como uma camada frontal de menor custo e o Sol como uma escalada verificada por gating, alcançando maior cobertura do que o Sol sozinho, enquanto permanece mais barato do que um único rollout do Sol.