对 GLM-5.3 和 GPT-5.6 Sol 在 DeepSWE 基准上的对比分析显示,级联路由策略优于单独使用任一模型。通过先运行 GLM-5.3,仅在测试失败时升级到 GPT-5.6 Sol,该系统以每个任务 $6.61 的成本解决了 85.9% 的任务。

  • GLM-5.3 每次推演的成本为 $3.99,而 Sol 为 $8.37,使其便宜 2.1 倍,每 100 美元可解决 17 个任务,而 Sol 仅为 9 个。
  • GPT-5.6 Sol 在单次准确率(pass@1 通过率为 72.7%)和可靠性(113 个任务中连续四次全部解决的有 61 个)方面领先,而 GLM-5.3 在 pass@2 上持平,并在 pass@4 上领先(87.6%)。
  • 两个模型之间的每任务相关性仅为 0.43,两者共同覆盖了 113 个任务中的 106 个,这使得有效的级联成为可能。
  • GLM-5.3 表现出更干净的故障模式,在失败案例中仅破坏现有测试的比例为 11%,而 Sol 为 20%,从而减少了对重型回归门控的需求。

该方法利用 GLM-5.3 作为低成本前端,并将 Sol 作为验证器门控的升级手段,在比单独使用 Sol 成本更低的同时实现了更高的覆盖率。