Moonshot AI의 오픈 가중치 모델인 Kimi K3는 DeepSWE 벤치마크에서 Anthropic의 Claude Fable 5와 비교할 만한 성능을 달성하면서도 작업당 비용이 훨씬 저렴합니다. 2026년 7월 16일 평가에서 Kimi K3는 pass@1 기준 68.5%를 기록하여 Fable 5의 69.9%에 근접했으나, 다중 시도 시나리오에서는 이를 능가하며 뛰어난 비용 효율성을 보였습니다.

  • Kimi K3의 롤아웃당 비용은 $4.65로 Claude Fable 5의 $13.41보다 낮으며, 달러당 해결된 작업 수가 2.8배 더 많습니다.
  • 단일 시도 신뢰도에서는 Fable 5가 우위(69.9% 대 68.5%)를 점령하지만, Kimi K3는 pass@2(82.0% 대 80.2%)와 pass@4(89.4% 대 88.5%)에서 승리했습니다.
  • Kimi K3는 더 넓은 범위의 작업을 커버하며, Fable 5의 107개 대비 101개의 고유한 작업을 해결했고 Go 분야에서 강력한 성능을 보였습니다.
  • 두 모델은 높은 상관관계(0.72)와 유사한 실패 패턴을 보여, 함께 사용될 때 상당한 다양성을 제공하지 않습니다.

Fable 5가 단일 시도 신뢰도에서 미세한 우위를 점하고 있음에도 불구하고, Kimi K3는 오픈 가중치 특성과 낮은 비용으로 인해 대량 처리 또는 재시도가 허용되는 에이전트 작업에 대한 합리적인 기본 선택으로 자리 잡고 있습니다.