xAI的Grok 4模型在Arc-AGI2基准测试中取得了15.9%的得分,超过了获得9.9%得分的OpenAI GPT5。
- Grok 4在Arc-AGI2基准测试中对GPT5保持显著领先。
- xAI计划到2025年底发布Grok 5。
- Grok 5的训练将使用相当于约300万个Nvidia H100或55万个B200芯片的计算能力。
xAI的Grok 4模型在Arc-AGI2基准测试中取得了15.9%的得分,超过了获得9.9%得分的OpenAI GPT5。
| Benchmark | 模型 | 得分 |
|---|---|---|
| ARC-AGI 2 | Grok 4 | 15.9% |
DeepSeek 声称其新发布的通用模型 DeepSeek V4 Flash 在 DeepSWE 基准测试中达到了与 Anthropic's Sonnet 5 和 xAI's Grok 4.5 相同的性能水平。
OpenAI 的 GPT-5 Pro 在 FrontierMath Tier 4 基准测试中创下新纪录,比 Google 的 Gemini 2.5 Deep Think 多解决了一道研究级数学问题。该评估涉及对由专业数学家开发的 50 道极难问题上的三个计算密集型模型设置进行人工评分。
为 GPT-5.6 启用两个特定的 API 设置使其在 ARC-AGI-3 基准测试中的性能得分翻了三倍。
在DeepSWE基准测试中对Kimi K3和GPT-5.6 Sol进行比较显示,尽管GPT-5.6 Sol在单次尝试质量方面领先(72.7% vs 68.5%),但Kimi K3以显著更低的成本实现了更高的pass@k分数(k > 1)。
研究人员开发了Intern-BioBreaker,这是一种专门的生物红队测试模型,通过将计算压力测试与湿实验验证相结合,来评估前沿大型语言模型的生物风险。研究发现,经过对齐的模型可以被诱导为安全敏感任务提供操作指导,并生成具有有害特性的序列级输出。