xAI的Grok 4模型在Arc-AGI2基准测试中取得了15.9%的得分,超过了获得9.9%得分的OpenAI GPT5。
- Grok 4在Arc-AGI2基准测试中对GPT5保持显著领先。
- xAI计划到2025年底发布Grok 5。
- Grok 5的训练将使用相当于约300万个Nvidia H100或55万个B200芯片的计算能力。
xAI的Grok 4模型在Arc-AGI2基准测试中取得了15.9%的得分,超过了获得9.9%得分的OpenAI GPT5。
| Benchmark | 模型 | 得分 |
|---|---|---|
| ARC-AGI 2 | Grok 4 | 15.9% |
DeepSeek 声称其新发布的通用模型 DeepSeek V4 Flash 在 DeepSWE 基准测试中达到了与 Anthropic's Sonnet 5 和 xAI's Grok 4.5 相同的性能水平。
OpenAI 的 GPT-5 Pro 在 FrontierMath Tier 4 基准测试中创下新纪录,比 Google 的 Gemini 2.5 Deep Think 多解决了一道研究级数学问题。该评估涉及对由专业数学家开发的 50 道极难问题上的三个计算密集型模型设置进行人工评分。
OpenAI 已发布两款新模型 GPT-6 Sol 和 GPT-6 Luna,现已在 OpenAI API 中上线。这两款模型位于此前发布的 GPT-6 Astra 之下,旨在将其技术优势带入更快、更实惠的层级,以应对复杂编码和高容量的日常任务。
Anthropic 发布了 Claude Opus 5.5,这是其全新 Claude 5.5 系列中的首款模型,定位为比前代更高效的选择。该模型旨在以低于 Opus 5 40%的运行成本,在大多数任务中达到与 Claude Fable 5.1 相当的性能水平。
英国人工智能安全研究所(AISI)已通过 EvalEval 的 Evaluation Cards 平台公开了评估方法和发现,以提高基准测试的可复现性。此次发布包含五个特定基准测试的验证结果、背景信息和配置信息:HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro 和 Terminal-Bench 2.0。
我们使用 Cookie 来统计访问量并改进网站。您可以接受或拒绝分析 Cookie。 隐私政策