DeepSWEベンチマークにおけるGLM-5.3とClaude Fable 5の比較により、両モデルがほぼ同一のファーストショット精度(69.0%対69.7%)を達成している一方で、GLM-5.3は大幅にコスト効率が良く、複数試行シナリオでもより優れたパフォーマンスを示すことが明らかになった。
- GLM-5.3のロールアウトあたりのコストは$3.99であり、Fable 5の$21.63と比較して5.4倍の価格差があり、その結果、$100あたりで17件の解決が可能となるのに対し、Fableでは3件にとどまる。
- 複数試行指標において、GLM-5.3はpass@2で81.1%(対77.1%)、pass@4で87.6%(対84.1%)とリードし、より高い上限を示している。
- 両モデルはタスクあたりの相関が0.65のほぼ代替可能な関係にあり、両方を実行してもカバレッジの多様性はほとんど追加されない。
- GLM-5.3は並列処理や耐久性を含む5つのタスクドメインで勝利したが、Fable 5はRust(85%対70%)とシリアライゼーション中心の作業のみでリードした。
分析の結果、GLM-5.3はその低コストと広範なカバレッジにより、ほとんどのソフトウェアエンジニアリングタスクにおいてデフォルトモデルとなるべきであり、Fable 5はRustやシリアライゼーションが重要な作業に限定された高コストのエスカレーションパスとして残すべきであると結論付けられている。