Kimi K3가 arena.ai의 새로운 FullStack 리더보드에서 1위를 차지했습니다.
이 모델은 새로 도입된 벤치마크에서 최상위 위치를 달성했습니다.
Kimi K3가 arena.ai의 새로운 FullStack 리더보드에서 1위를 차지했습니다.
이 모델은 새로 도입된 벤치마크에서 최상위 위치를 달성했습니다.
한 사용자가 Sonnet 4.6을 사용하여 34개의 원샷 프롬프트를 실행하고 결과로 나온 HTML, 스크린샷 및 GIF를 평가하여 Claude Opus 4.8 대비 Kimi K3를 평가했습니다. 평가 결과 Kimi K3가 Opus 4.8보다 더 나은 결과를 생성했습니다.
DeepSWE 벤치마크에서의 Kimi K3와 GPT-5.6 Sol 비교 결과, GPT-5.6 Sol이 단일 추론 품질(72.7% 대 68.5%)에서 앞섰지만, Kimi K3는 훨씬 낮은 비용으로 k > 1에 대해 더 높은 pass@k 점수를 달성했습니다.
Moonshot AI의 오픈 가중치 모델인 Kimi K3는 DeepSWE 벤치마크에서 Anthropic의 Claude Fable 5와 비교할 만한 성능을 달성하면서도 작업당 비용이 훨씬 저렴합니다. 2026년 7월 16일 평가에서 Kimi K3는 pass@1 기준 68.5%를 기록하여 Fable 5의 69.9%에 근접했으나, 다중 시도 시나리오에서는 이를 능가하며 뛰어난 비용 효율성을 보였습니다.
Artificial Analysis에 따르면 Kimi-K3의 출시로 오픈소스와 클로즈드소스 AI 최전선 사이의 시간 차이가 불과 1.5개월로 줄었습니다.
Agent Arena 리더보드에 따르면 Kimi K3은 비시각 작업에서 Opus와 비교 가능한 수준의 성능을 보입니다. 일부 사용자는 Opus가 시각 기능에서 우위를 가질 수 있다고 지적하지만, 순위는 다른 사용 사례에서 동등함을 나타냅니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침