본 기사는 Kimi K3 (max)가 Simple Bench 벤치마크에서 Sonnet 5보다 우수한 성능을 보인다고 보도합니다.
- Kimi K3 (max)는 이 특정 평가에서 Sonnet 5보다 높은 점수를 달성했습니다.
본 기사는 Kimi K3 (max)가 Simple Bench 벤치마크에서 Sonnet 5보다 우수한 성능을 보인다고 보도합니다.
한 연구는 150건의 합성 폴란드어 일차 진료 상담을 통해 임상 AI 시스템 Doctorina를 8명의 의사 및 4개의 독립형 프론티어 언어 모델과 비교했습니다.
한 사용자가 Sonnet 4.6을 사용하여 34개의 원샷 프롬프트를 실행하고 결과로 나온 HTML, 스크린샷 및 GIF를 평가하여 Claude Opus 4.8 대비 Kimi K3를 평가했습니다. 평가 결과 Kimi K3가 Opus 4.8보다 더 나은 결과를 생성했습니다.
Moonshot AI의 오픈 가중치 모델인 Kimi K3는 DeepSWE 벤치마크에서 Anthropic의 Claude Fable 5와 비교할 만한 성능을 달성하면서도 작업당 비용이 훨씬 저렴합니다. 2026년 7월 16일 평가에서 Kimi K3는 pass@1 기준 68.5%를 기록하여 Fable 5의 69.9%에 근접했으나, 다중 시도 시나리오에서는 이를 능가하며 뛰어난 비용 효율성을 보였습니다.
Agent Arena 리더보드에 따르면 Kimi K3은 비시각 작업에서 Opus와 비교 가능한 수준의 성능을 보입니다. 일부 사용자는 Opus가 시각 기능에서 우위를 가질 수 있다고 지적하지만, 순위는 다른 사용 사례에서 동등함을 나타냅니다.
Kimi K3가 AfterQuery의 SpreadsheetBench 2 평가에서 최상위 위치를 달성했습니다. 이 결과는 이 특정 벤치마크에서 Claude Fable 5보다 앞서게 합니다.
트래픽 측정과 사이트 개선을 위해 쿠키를 사용합니다. 분석 쿠키를 허용하거나 거부할 수 있습니다. 개인정보처리방침