Kimi K3가 AfterQuery의 SpreadsheetBench 2 평가에서 최상위 위치를 달성했습니다. 이 결과는 이 특정 벤치마크에서 Claude Fable 5보다 앞서게 합니다.
media
r/LocalLLaMA
·
54일 전
·
open_models
Kimi K3, AfterQuery의 SpreadsheetBench 2에서 1위 차지, Claude Fable 5 앞지름
번역 English → 한국어
관련 기사
arxiv
arXiv cs.AI
·
1일 전
·
조회수 1회
Doctorina가 합성 폴란드어 일차 진료 진단에서 의사보다 우수
한 연구는 150건의 합성 폴란드어 일차 진료 상담을 통해 임상 AI 시스템 Doctorina를 8명의 의사 및 4개의 독립형 프론티어 언어 모델과 비교했습니다.
media
r/LocalLLaMA
·
41일 전
·
조회수 12회
Kimi K3가 원샷 HTML 생성에서 Opus 4.8을 능가
한 사용자가 Sonnet 4.6을 사용하여 34개의 원샷 프롬프트를 실행하고 결과로 나온 HTML, 스크린샷 및 GIF를 평가하여 Claude Opus 4.8 대비 Kimi K3를 평가했습니다. 평가 결과 Kimi K3가 Opus 4.8보다 더 나은 결과를 생성했습니다.
media
Together AI Blog
·
48일 전
·
조회수 24회
Kimi K3는 DeepSWE 품질에서 Claude Fable 5와 동급이며 비용은 1/3 수준
Moonshot AI의 오픈 가중치 모델인 Kimi K3는 DeepSWE 벤치마크에서 Anthropic의 Claude Fable 5와 비교할 만한 성능을 달성하면서도 작업당 비용이 훨씬 저렴합니다. 2026년 7월 16일 평가에서 Kimi K3는 pass@1 기준 68.5%를 기록하여 Fable 5의 69.9%에 근접했으나, 다중 시도 시나리오에서는 이를 능가하며 뛰어난 비용 효율성을 보였습니다.
media
r/LocalLLaMA
·
52일 전
·
조회수 20회
Kimi K3, Agent Arena에서 Opus 사고와 동일한 수준으로 랭킹
Agent Arena 리더보드에 따르면 Kimi K3은 비시각 작업에서 Opus와 비교 가능한 수준의 성능을 보입니다. 일부 사용자는 Opus가 시각 기능에서 우위를 가질 수 있다고 지적하지만, 순위는 다른 사용 사례에서 동등함을 나타냅니다.
media
r/LocalLLaMA
·
54일 전
·
조회수 7회
Kimi K3 (max), Simple Bench에서 Sonnet 5 압도
본 기사는 Kimi K3 (max)가 Simple Bench 벤치마크에서 Sonnet 5보다 우수한 성능을 보인다고 보도합니다.