文章报道 Kimi K3 (max) 在 Simple Bench 基准测试中优于 Sonnet 5。
- Kimi K3 (max) 在该特定评估中得分高于 Sonnet 5。
文章报道 Kimi K3 (max) 在 Simple Bench 基准测试中优于 Sonnet 5。
一项研究将临床AI系统Doctorina与8名医生和4个独立的领先语言模型进行了比较,测试场景为150次合成的波兰语初级保健咨询。
一位用户通过运行 34 个单样本提示并评估生成的 HTML、截图和 GIF,将 Kimi K3 与 Claude Opus 4.8 进行了对比评估。评估结论是 Kimi K3 产生的结果优于 Opus 4.8。
月之暗面(Moonshot AI)推出的开源权重模型Kimi K3在DeepSWE基准测试中取得了与Anthropic的Claude Fable 5相当的性能,同时每项任务的成本显著更低。在2026年7月16日的一次评估中,Kimi K3的pass@1达到68.5%,略低于Fable 5的69.9%,但在多次尝试场景中表现更优,并提供了更高的成本效益。
根据Agent Arena排行榜,Kimi K3在非视觉任务中的表现与Opus相当。虽然一些用户指出Opus在视觉能力方面可能具有优势,但排名表明在其他用例中两者势均力敌。
Kimi K3在AfterQuery的SpreadsheetBench 2评估中取得了首位。这一结果使其在该特定基准测试中领先于Claude Fable 5。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策