GLM-5.3 与 Claude Fable 5 在 DeepSWE 基准上的对比显示,尽管两个模型的首次尝试准确率几乎相同(69.0% vs 69.7%),但 GLM-5.3 的成本效益显著更高,且在多次尝试场景中表现更佳。
- GLM-5.3 每次推演的成本为 3.99 美元,而 Fable 5 为 21.63 美元,5.4 倍的价格差距使得每 100 美元可解决 17 个问题,而 Fable 仅能解决 3 个。
- 在多次尝试指标方面,GLM-5.3 以 pass@2 81.1%(对比 77.1%)和 pass@4 87.6%(对比 84.1%)领先,显示出更高的上限。
- 两个模型近乎可互换,任务间相关系数为 0.65,意味着同时运行两者对覆盖多样性的提升微乎其微。
- GLM-5.3 在包括并发性和耐久性在内的五个任务领域胜出,而 Fable 5 仅在 Rust(85% vs 70%)和序列化密集型工作中领先。
分析结论认为,GLM-5.3 应作为大多数软件工程任务的默认模型,因其成本更低且覆盖范围更广,而 Fable 5 则保留为专门针对 Rust 或序列化关键工作的昂贵升级路径。