DeepSWE 벤치마크에서의 Kimi K3와 GPT-5.6 Sol 비교 결과, GPT-5.6 Sol이 단일 추론 품질(72.7% 대 68.5%)에서 앞섰지만, Kimi K3는 훨씬 낮은 비용으로 k > 1에 대해 더 높은 pass@k 점수를 달성했습니다.

  • Kimi K3는 pass@2(82.0% 대 81.0%)와 pass@4(89.4% 대 85.8%)에서 승리하며, 플래그십급 구성 중 최고의 pass@4 기록을 세웠습니다.
  • Kimi K3의 롤아웃당 비용은 $4.65로 GPT-5.6 Sol의 $8.37보다 낮으며, 달러당 해결된 작업 수가 2.8배 더 많습니다.
  • 두 모델은 상당한 차이(0.46 상관관계)를 보이며 다르게 실패하므로, Sol로 승격하는 Kimi 우선 캐스케이드를 통해 113개 작업 중 108개를 커버할 수 있습니다.
  • GPT-5.6 Sol은 더 신뢰할 수 있어 61개의 작업을 네 번 모두 성공시켰지만(반면 Kimi K3는 45개), 롤아웃당 시간이 더 오래 걸렸습니다(17분 대 66분).

두 모델 간 라우팅은 강력한 실용적 솔루션을 제공하며, Kimi 우선 캐스케이드는 약 85.6%의 정확도를 달성하면서도 GPT-5.6 Sol 단독 사용보다 저렴합니다.