在 DeepSWE 基准测试中对 DeepSeek V4 Pro 0813 和 Claude Fable 5 进行比较显示,使用这两种模型的路由策略以每个任务 8.28 美元的成本解决了 82.7% 的任务,优于单独使用 Fable(69.7%),且成本显著更低。

  • Claude Fable 5 在单次尝试准确率方面领先(pass@1 为 69.7%),并在 Rust 领域(85%)和序列化密集型工作中表现出色,但每次推演的成本为 21.63 美元,大约是 DeepSeek V4 Pro 0813 的 90 倍。
  • DeepSeek V4 Pro 0813 成本更低(每次推演 0.24 美元),并在多次尝试中实现更高的准确率(pass@4 为 88.5%,而 Fable 为 84.1%),使其成为高吞吐量或可容忍重试场景的更高性价比选择。
  • 这两个模型在任务间的关联性较低(0.39),共同覆盖了 113 个任务中的 107 个,这证明了级联方法的合理性:先运行 Pro,仅在必要时升级到 Fable。

分析表明,Fable 5 最好作为针对 Rust 等特定领域的选择性升级模型,而非默认模型;而 DeepSeek V4 Pro 0813 则以极低的成本提供了接近 Fable 的准确率。