Uma comparação entre GLM-5.3 e Claude Fable 5 no benchmark DeepSWE revela que, embora ambos os modelos alcancem uma precisão de primeira tentativa quase idêntica (69,0% contra 69,7%), o GLM-5.3 é significativamente mais econômico e tem melhor desempenho em cenários de múltiplas tentativas.
- O GLM-5.3 custa US$ 3,99 por rollout, comparado aos US$ 21,63 do Fable 5, uma diferença de preço de 5,4x que resulta em 17 resoluções por US$ 100 contra as 3 do Fable.
- Nas métricas de múltiplas tentativas, o GLM-5.3 lidera com pass@2 em 81,1% (contra 77,1%) e pass@4 em 87,6% (contra 84,1%), demonstrando um teto mais alto.
- Os modelos são quase substitutos, com uma correlação por tarefa de 0,65, o que significa que executar ambos adiciona pouca diversidade de cobertura.
- O GLM-5.3 vence em cinco domínios de tarefas, incluindo concorrência e durabilidade, enquanto o Fable 5 lidera apenas em Rust (85% contra 70%) e em trabalhos com alta carga de serialização.
A análise conclui que o GLM-5.3 deve ser o modelo padrão para a maioria das tarefas de engenharia de software devido ao seu menor custo e cobertura mais ampla, com o Fable 5 reservado como um caminho de escalonamento caro especificamente para trabalho crítico em Rust ou serialização.