Uma comparação entre GLM-5.3 e sua variante destilada, GLM-5.3 Flash, no benchmark DeepSWE revela que a destilação preserva a capacidade central de codificação enquanto reduz significativamente os custos de rollout. O modelo completo alcança uma taxa pass@1 de 69,0% a $3,99 por tarefa, enquanto a variante Flash obtém 63,4% por apenas $0,24, representando uma redução de preço de 17x.
- A lacuna de qualidade diminui de 5,6 pontos em pass@1 para 2,6 pontos em pass@4 (87,6% contra 85,0%), indicando que a perda é principalmente de confiabilidade e não de capacidade.
- GLM-5.3 Flash custa $0,24 por rollout comparado a $3,99 do modelo completo, resultando em 264 tarefas resolvidas por $100 versus 17.
- A variante Flash perde a capacidade de converter esforço extra em sucesso em tarefas instáveis, com execuções bem-sucedidas exigindo mais passos apenas 46% das vezes, comparado a 61% para o modelo completo.
- A destilação remodelou o perfil de desempenho, ganhando terreno em concorrência, Python e modelagem de dados enquanto cede JavaScript e trabalhos pesados em consultas.
- Uma regressão notável é a redução da cautela, com o Flash falhando nos testes de base em 6,9% dos rollouts versus 4,4% para o modelo completo.
Executar GLM-5.3 Flash primeiro e escalar para o modelo completo apenas após rejeição resolve 80,9% das tarefas DeepSWE a $1,70 cada, oferecendo uma estratégia econômica para cargas de trabalho limitadas por throughput.