Kimi K3在arena.ai的全新FullStack排行榜上位居榜首。
该模型在该新推出的基准测试中取得了第一名。
Kimi K3在arena.ai的全新FullStack排行榜上位居榜首。
该模型在该新推出的基准测试中取得了第一名。
一位用户通过运行 34 个单样本提示并评估生成的 HTML、截图和 GIF,将 Kimi K3 与 Claude Opus 4.8 进行了对比评估。评估结论是 Kimi K3 产生的结果优于 Opus 4.8。
在DeepSWE基准测试中对Kimi K3和GPT-5.6 Sol进行比较显示,尽管GPT-5.6 Sol在单次尝试质量方面领先(72.7% vs 68.5%),但Kimi K3以显著更低的成本实现了更高的pass@k分数(k > 1)。
月之暗面(Moonshot AI)推出的开源权重模型Kimi K3在DeepSWE基准测试中取得了与Anthropic的Claude Fable 5相当的性能,同时每项任务的成本显著更低。在2026年7月16日的一次评估中,Kimi K3的pass@1达到68.5%,略低于Fable 5的69.9%,但在多次尝试场景中表现更优,并提供了更高的成本效益。
根据Artificial Analysis的数据,Kimi-K3的发布将开源和闭源AI前沿之间的时间滞后缩短至仅1.5个月。
根据Agent Arena排行榜,Kimi K3在非视觉任务中的表现与Opus相当。虽然一些用户指出Opus在视觉能力方面可能具有优势,但排名表明在其他用例中两者势均力敌。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策