在 DeepSWE 基准测试中对 DeepSeek-V4 Flash 0731 和 GPT-5.6 Luna 进行的比较显示,虽然 GPT-5.6 Luna 是更强的工程师模型,但结合使用这两种模型的级联策略能以更低的成本实现更高的准确率。
- GPT-5.6 Luna 在 DeepSWE 的 pass@1 指标上以 67.2% 对 DeepSeek 的 53.3% 占据决定性优势,并在每次尝试次数相等时始终保持领先。
- DeepSeek-V4 Flash 是现有模型中最便宜的,每次 rollout 成本为 0.10 美元,每 100 美元可解决 532 个问题,而 Luna 仅为 110 个。
- 先运行 DeepSeek,仅在失败时升级到 Luna,能以每个任务 0.385 美元的成本解决 78.9% 的任务,在准确率和成本方面均优于单独使用 Luna。
- DeepSeek 的失败更干净,在 9% 的失败案例中破坏了仓库现有的测试套件,而 Luna 的这一比例为 15%。
级联方法利用 DeepSeek 的低价格清除大约一半的任务,使旗舰模型能够专注于更难的问题,从而产生比单独使用任一模型更优的综合结果。