Kimi K3在AfterQuery的SpreadsheetBench 2评估中取得了首位。这一结果使其在该特定基准测试中领先于Claude Fable 5。
media
r/LocalLLaMA
·
54 天前
·
open_models
Kimi K3在AfterQuery的SpreadsheetBench 2上排名第一,超越Claude Fable 5
译自 English → 中文
相关文章
arxiv
arXiv cs.AI
·
1 天前
·
1 次浏览
Doctorina在合成波兰语初级保健诊断中优于医生
一项研究将临床AI系统Doctorina与8名医生和4个独立的领先语言模型进行了比较,测试场景为150次合成的波兰语初级保健咨询。
media
r/LocalLLaMA
·
41 天前
·
12 次浏览
Kimi K3 在单样本 HTML 生成中优于 Opus 4.8
一位用户通过运行 34 个单样本提示并评估生成的 HTML、截图和 GIF,将 Kimi K3 与 Claude Opus 4.8 进行了对比评估。评估结论是 Kimi K3 产生的结果优于 Opus 4.8。
media
Together AI Blog
·
48 天前
·
24 次浏览
Kimi K3在DeepSWE质量上与Claude Fable 5持平,成本仅为三分之一
月之暗面(Moonshot AI)推出的开源权重模型Kimi K3在DeepSWE基准测试中取得了与Anthropic的Claude Fable 5相当的性能,同时每项任务的成本显著更低。在2026年7月16日的一次评估中,Kimi K3的pass@1达到68.5%,略低于Fable 5的69.9%,但在多次尝试场景中表现更优,并提供了更高的成本效益。
media
r/LocalLLaMA
·
52 天前
·
20 次浏览
Kimi K3在Agent Arena上的推理水平与Opus持平
根据Agent Arena排行榜,Kimi K3在非视觉任务中的表现与Opus相当。虽然一些用户指出Opus在视觉能力方面可能具有优势,但排名表明在其他用例中两者势均力敌。
media
r/LocalLLaMA
·
54 天前
·
7 次浏览
Kimi K3 (max) 在 Simple Bench 上击败 Sonnet 5
文章报道 Kimi K3 (max) 在 Simple Bench 基准测试中优于 Sonnet 5。