Une comparaison entre GLM-5.3 et sa variante distillée, GLM-5.3 Flash, sur le benchmark DeepSWE révèle que la distillation préserve les capacités fondamentales de codage tout en réduisant significativement les coûts de rollout. Le modèle complet atteint un taux pass@1 de 69,0 % à 3,99 $ par tâche, tandis que la variante Flash obtient 63,4 % pour seulement 0,24 $, représentant une réduction de prix de 17x.

  • L'écart de qualité se réduit de 5,6 points au pass@1 à 2,6 points au pass@4 (87,6 % contre 85,0 %), indiquant que la perte concerne principalement la fiabilité plutôt que la capacité.
  • GLM-5.3 Flash coûte 0,24 $ par rollout contre 3,99 $ pour le modèle complet, permettant de résoudre 264 tâches par 100 $ contre 17.
  • La variante Flash perd la capacité à transformer un effort supplémentaire en succès sur des tâches instables, les exécutions réussies nécessitant plus d'étapes seulement 46 % du temps contre 61 % pour le modèle complet.
  • La distillation a remodelé le profil de performance, gagnant du terrain en concurrence, Python et modélisation de données tout en cédant JavaScript et les travaux lourds en requêtes.
  • Une régression notable est une prudence réduite, la variante Flash échouant aux tests de base dans 6,9 % des rollouts contre 4,4 % pour le modèle complet.

Exécuter GLM-5.3 Flash en premier et passer au modèle complet uniquement en cas de rejet permet de résoudre 80,9 % des tâches DeepSWE à 1,70 $ chacune, offrant une stratégie rentable pour les charges de travail limitées par le débit.