两项 API 设置使 GPT-5.6 在 ARC-AGI-3 上的得分翻了三倍
为 GPT-5.6 启用两个特定的 API 设置使其在 ARC-AGI-3 基准测试中的性能得分翻了三倍。
为 GPT-5.6 启用两个特定的 API 设置使其在 ARC-AGI-3 基准测试中的性能得分翻了三倍。
Z.ai宣布推出GLM-5.3,这是一款通过在基础模型GLM-5.2上扩展后训练阶段,在智能体编程基准测试中取得前沿性能的新模型。该~750B参数模型目前在各种基准测试中超越了Kimi K3,并持平或超越了Claude Fable 5和GPT-5.6-Sol。
在 DeepSWE 基准测试中对 DeepSeek-V4 Flash 0731 和 GPT-5.6 Luna 进行的比较显示,虽然 GPT-5.6 Luna 是更强的工程师模型,但结合使用这两种模型的级联策略能以更低的成本实现更高的准确率。
阿里巴巴宣布推出Qwen3.8-Max作为其最新旗舰模型,描述其为专注于长周期智能体工作、编码和多模态推理的2.4T参数稀疏架构。该公司确认,Qwen3.8-Max的开源权重将于下周发布,同时还将开放Qwen3.8-27B变体的权重。
DeepSeek 已更新其 V4 Flash 模型,于 2026-07-31 发布新版本,相比之前的预览版性能显著提升。此次更新引入了多个新基准测试的结果,并提升了现有基准的得分。
在DeepSWE基准测试中对Kimi K3和GPT-5.6 Sol进行比较显示,尽管GPT-5.6 Sol在单次尝试质量方面领先(72.7% vs 68.5%),但Kimi K3以显著更低的成本实现了更高的pass@k分数(k > 1)。
Anthropic推出了Claude Opus 5模型,其编码和通用能力指标的表现受到审视,同时前沿模型评估的争论再次升温。
Anthropic 发布了 Claude Opus 5,这是一款前沿模型,引发了关于基准分数和实际性能的广泛讨论。Epoch AI 的独立评估报告显示,该新模型的 Epoch Capabilities Index (ECI) 为 159,SWE-ECI 为 161。
月之暗面(Moonshot AI)推出的开源权重模型Kimi K3在DeepSWE基准测试中取得了与Anthropic的Claude Fable 5相当的性能,同时每项任务的成本显著更低。在2026年7月16日的一次评估中,Kimi K3的pass@1达到68.5%,略低于Fable 5的69.9%,但在多次尝试场景中表现更优,并提供了更高的成本效益。
Sierra Research 发布了 τ-bench 1.0.1,修正了 `banking_knowledge` 任务的评分方案,停止因审慎的验证读取而惩罚代理,并修复了若干数据不一致问题。此次更新确保重新评分排行榜轨迹仅提升分数,此前通过的模拟不再失败。
7月16日,Moonshot AI 发布了其最新旗舰模型 Kimi K3,这是一款拥有 2.8 万亿参数的混合专家(MoE)架构。该公司承诺将于7月27日发布该模型的权重。
Moonshot发布了Kimi K3,这是一款开源权重模型,引发了对中文模型距离前沿水平有多近的重新评估。该发布的显著特点是在编码、智能体任务和长周期知识工作方面表现出色。
Moonshot AI 推出了 Kimi K3,这是一款新的前沿级开放权重模型,具有 2.8 万亿总参数和原生多模态输入能力。该模型正式定位为“开放前沿智能”,支持 100 万 token 的上下文窗口,并利用 Kimi Delta Attention (KDA) 和 Attention Residuals 等新颖架构组件来提升效率。
Moonshot AI推出了Kimi K3,这是一款前沿级开放权重模型,拥有2.8万亿参数和原生多模态输入。该模型采用Kimi Delta Attention(KDA)技术,可在长上下文中实现更快的解码速度,并定位为支持长周期智能体编码工作流。
中国 AI 实验室 Moonshot AI 发布了 Kimi K3,称其为迄今为止最强大的模型,拥有 2.8 万亿个参数。该模型目前可通过网站和 API 使用,并承诺在 2026 年 7 月 27 日前开放权重。
DharmaOCR 通过领域特定训练,在巴西葡萄牙语上的提取质量和稳定性优于 Mistral OCR4 和 Unlimited-OCR。
Qwen已发布Qwen3.8-27B模型,可在ModelScope和Hugging Face上下载。
文章重点展示了 Gemini 3.7 Flash 更新中的一张图表,显示之前的版本(特别是 3.5 和 3.6 Flash)在性能上落后于更新的 Claude 4.8+ 和 GPT 5.5+ 系列模型。
一位 Reddit 用户强调了 DeepSeek DSv4 Flash 0731 模型,指出其相对于成本的强大性能。该帖子引用了 Artificial Analysis Intelligence Index v4.1.1 来支持该模型表现出色的说法。
专为中低收入环境设计的检索增强生成系统 VITA,在 HealthBench 基准测试中与通用大型语言模型进行了对比评估。研究表明,即使随着更新的前沿模型发布,针对语料库的特定设计仍能保持具有竞争力的性能。