Une comparaison entre GLM-5.3 et Claude Fable 5 sur le benchmark DeepSWE révèle que, bien que les deux modèles atteignent une précision au premier essai quasi identique (69,0 % contre 69,7 %), GLM-5.3 est nettement plus rentable et offre de meilleures performances dans les scénarios à multiples tentatives.

  • GLM-5.3 coûte 3,99 $ par rollout contre 21,63 $ pour Fable 5, un écart de prix de 5,4x qui se traduit par 17 résolutions pour 100 $ contre 3 pour Fable.
  • Dans les métriques à multiples tentatives, GLM-5.3 mène avec un pass@2 de 81,1 % (contre 77,1 %) et un pass@4 de 87,6 % (contre 84,1 %), démontrant un plafond plus élevé.
  • Les modèles sont quasi substituables avec une corrélation par tâche de 0,65, ce qui signifie que l'exécution des deux ajoute peu de diversité de couverture.
  • GLM-5.3 remporte cinq domaines de tâches, y compris la concurrence et la durabilité, tandis que Fable 5 ne mène que dans le domaine du Rust (85 % contre 70 %) et les travaux lourds en sérialisation.

L'analyse conclut que GLM-5.3 devrait être le modèle par défaut pour la plupart des tâches d'ingénierie logicielle grâce à son coût inférieur et sa couverture plus large, Fable 5 étant réservé comme une voie d'escalade coûteuse spécifiquement pour le Rust ou les travaux critiques en sérialisation.