月之暗面(Moonshot AI)推出的开源权重模型Kimi K3在DeepSWE基准测试中取得了与Anthropic的Claude Fable 5相当的性能,同时每项任务的成本显著更低。在2026年7月16日的一次评估中,Kimi K3的pass@1达到68.5%,略低于Fable 5的69.9%,但在多次尝试场景中表现更优,并提供了更高的成本效益。

  • Kimi K3每次推演的成本为4.65美元,而Claude Fable 5为13.41美元,每美元可解决的任务量多出2.8倍。
  • 尽管Fable 5在单次尝试可靠性方面领先(69.9%对68.5%),但Kimi K3在pass@2(82.0%对80.2%)和pass@4(89.4%对88.5%)中胜出。
  • Kimi K3覆盖的任务范围更广,解决了101个独特任务,而Fable 5为107个,在Go任务中表现强劲。
  • 两个模型表现出高相关性(0.72)和相似的失败模式,意味着它们在配对使用时无法提供显著的多样性。

尽管Fable 5在单次尝试可靠性方面略有优势,但Kimi K3凭借其开源权重特性和较低成本,被定位为适用于大规模或可容忍重试的代理工作流的理性默认选择。