在DeepSWE基准测试中对Kimi K3和GPT-5.6 Sol进行比较显示,尽管GPT-5.6 Sol在单次尝试质量方面领先(72.7% vs 68.5%),但Kimi K3以显著更低的成本实现了更高的pass@k分数(k > 1)。

  • Kimi K3在pass@2(82.0% vs 81.0%)和pass@4(89.4% vs 85.8%)中获胜,达到了任何旗舰级配置的最佳pass@4成绩。
  • Kimi K3每次展开的成本为4.65美元,而GPT-5.6 Sol为8.37美元,每美元能解决的任务量是后者的2.8倍。
  • 这两个模型差异显著(相关系数0.46)且失败模式不同,通过优先使用Kimi并在必要时升级到Sol的组合策略,可以覆盖113项任务中的108项。
  • GPT-5.6 Sol更可靠,四次尝试全部解决61项任务,而Kimi K3解决了45项,但每次展开耗时更长(17分钟 vs 66分钟)。

在这两个模型之间进行路由提供了强大的实用解决方案,优先使用Kimi的级联策略在成本低于单独使用GPT-5.6 Sol的同时,达到了约85.6%的准确率。