Base-10的Charlie O'Neill在最近一期与Dwarkesh Patel合作的节目中讨论了为什么Kimi和GLM模型“几乎客观上”优于Opus 5。
该讨论涉及对AI进步的怀疑态度,指出研究人员发现了大量容易获取的成果,而非遇到数据瓶颈。它还涵盖了Patel从怀疑到相信行业正朝着创造AGI和RSI方向稳步发展的转变。
Base-10的Charlie O'Neill在最近一期与Dwarkesh Patel合作的节目中讨论了为什么Kimi和GLM模型“几乎客观上”优于Opus 5。
该讨论涉及对AI进步的怀疑态度,指出研究人员发现了大量容易获取的成果,而非遇到数据瓶颈。它还涵盖了Patel从怀疑到相信行业正朝着创造AGI和RSI方向稳步发展的转变。
对 GLM-5.3 和 GPT-5.6 Sol 在 DeepSWE 基准上的对比分析显示,级联路由策略优于单独使用任一模型。通过先运行 GLM-5.3,仅在测试失败时升级到 GPT-5.6 Sol,该系统以每个任务 $6.61 的成本解决了 85.9% 的任务。
在DeepSWE基准测试中对Kimi K3和GPT-5.6 Sol进行比较显示,尽管GPT-5.6 Sol在单次尝试质量方面领先(72.7% vs 68.5%),但Kimi K3以显著更低的成本实现了更高的pass@k分数(k > 1)。
对三种开源稀疏混合专家模型——月之暗面的 Kimi K3、DeepSeek V4 Pro 以及智谱 AI 的 GLM-5.2——进行了比较,评估了它们在长周期编码和智能体工作负载方面的能力、许可条款及服务成本。
一项对六个广泛使用的物理基准测试进行的审计研究发现,前沿语言模型报告的较低得分主要源于基准测试错误,而非模型缺陷。专家审查了问题陈述、参考解决方案和模型响应,区分了真实错误、评分器失误、不正确的参考以及模糊的问题。
Cognition发布了SWE-2,这是其迄今为止最强大的编码模型,该模型在Moonshot AI的2.8T参数开源模型Kimi K3的基础上通过强化学习进行了后训练。该模型在FrontierCode 1.1 Main上得分50.0%,仅比Fable 5.1低一分,同时成本降低了64%。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策