在 DeepSWE 基准测试中,对 DeepSeek V4 Pro 0813 和 GPT-5.6 Sol 进行的比较表明,先运行 DeepSeek,并在测试失败时升级到 GPT-5.6 Sol,可在每个任务成本为 3.35 美元的情况下实现 83.0% 的通过率。

  • DeepSeek V4 Pro 0813 每次生成的成本为 0.24 美元,比 GPT-5.6 Sol 的 8.37 美元便宜 35 倍。
  • 尽管 GPT-5.6 Sol 以 72.7% 的 pass@1 通过率在单次尝试准确率方面领先,但 DeepSeek V4 Pro 0813 在四次尝试中以 88.5% 的 pass@4 得分超越它。
  • 该级联策略优于单独运行任一模型,并以低于 GPT-5.6 Sol 单任务成本一半的价格实现了 83.0% 的覆盖率,表现甚至超过了完美的单次尝试路由 oracle。
  • GPT-5.6 Sol 在延迟敏感型任务中仍占优势,其生成耗时为 17 分钟,而 DeepSeek 需要 35 分钟;在包括 Python 和 Go 在内的八个任务领域中,GPT-5.6 Sol 赢得了六个领域。

这种路由策略允许用户将 DeepSeek V4 Pro 0813 作为低成本前端来处理大部分工作负载,仅将昂贵的 GPT-5.6 Sol 保留给需要其更高精度的困难任务。