在DeepSWE基准测试上对GLM-5.3及其蒸馏变体GLM-5.3 Flash的比较显示,蒸馏保留了核心编码能力,同时显著降低了 rollout 成本。完整模型在每个任务上的 pass@1 速率为69.0%,成本为$3.99;而Flash变体的得分仅为63.4%,成本低至$0.24,实现了17倍的价格降低。

  • 质量差距从pass@1的5.6分缩小到pass@4的2.6分(87.6%对比85.0%),表明损失主要在于可靠性而非能力。
  • GLM-5.3 Flash每次rollout成本为$0.24,而完整模型为$3.99,每$100可解决的任务数从17个增加到264个。
  • Flash变体失去了将额外努力转化为成功的能力,在flaky任务上,通过性rollout所需的步数增加的情况仅占46%,而完整模型为61%。
  • 蒸馏重塑了性能分布,在并发、Python和数据建模方面取得进展,但在JavaScript和查询密集型工作方面有所退让。
  • 一个显著的退化是谨慎性降低,Flash变体在6.9%的rollout中破坏了基准测试,而完整模型为4.4%。

先运行GLM-5.3 Flash,仅在拒绝时升级到完整模型,可以在每个任务$1.70的成本下解决80.9%的DeepSWE任务,为吞吐量受限的工作负载提供了一种具有成本效益的策略。