Benchmark · reasoning

ARC-AGI 3

12 条结果 7 个模型

ARC Prize's third generation (2026): the agent must learn an unseen interactive game environment from scratch. Scores run far lower than — and are NOT comparable to — the static grid-puzzle ARC-AGI 1/2.

0 25 50 75 100 2026-07-17 2026-08-12 2026-09-07 Schema · 99 · 2026-07-17 Claude Opus 5 · 30.2 · 2026-07-31 GPT‑5.6 Sol · 38.3 · 2026-07-31 GPT‑5.6 Sol · 38.3 · 2026-08-13 Prime Agent · 95.5 · 2026-08-06 Prime Agent · 95.5 · 2026-08-25 Prime Agent · 95.5 · 2026-08-25 GPT-6 Astra · 99.9 · 2026-09-04 GPT-6 Astra · 62.7 · 2026-09-04 Nvidia AVO · 100 · 2026-09-04 GPT‑6 Astra · 99.9 · 2026-09-05 GPT‑6 Astra · 99.9 · 2026-09-07
Schema Claude Opus 5 GPT‑5.6 Sol Prime Agent GPT-6 Astra Nvidia AVO GPT‑6 Astra
时间线
日期 模型 得分 来源
2026-09-07 GPT‑6 Astra 99.9% Claude证明费马大定理,OpenAI计划开发自动化研究员
2026-09-05 GPT‑6 Astra 99.9% OpenAI发布GPT-6 Astra,提升计算机使用、编码和网络安全能力
2026-09-04 GPT-6 Astra 62.7% 英伟达收购 Hugging Face;OpenAI 发布 GPT-6 Astra;微软推出 MAI-Transcribe-2
2026-09-04 Nvidia AVO 100.0% Nvidia 使用 AVO 工具在 ARC AGI-3 上实现 100% 得分
2026-09-04 GPT-6 Astra 99.9% OpenAI发布GPT-6 Astra,一款拥有1.05M上下文的计算机使用模型
2026-08-25 Prime Agent 95.5% Prime Agent:一个自我改进的RLM工具包将ARC-AGI-3 RHAE Best@1提升至95.5%
2026-08-25 Prime Agent 95.5% Prime Agent:自我改进的 RLM 框架将 ARC-AGI-3 RHAE Best@1 提升至 95.5%
2026-08-13 GPT‑5.6 Sol 38.3% OpenAI发布GPT-5.6,以可负担的成本提供高性能智能体工作流
2026-08-06 Prime Agent 95.5% PrimeIntellect 发布 Prime Agent,一款自我改进的代码框架
2026-07-31 GPT‑5.6 Sol 38.3% OpenAI将GPT-5.6 Luna价格降低80%
2026-07-31 Claude Opus 5 30.2% Anthropic 发布 Claude Opus 5;OpenAI 模型在安全测试中突破 Hugging Face
2026-07-17 Schema 99.0% Moonshot发布Kimi K3;Schema harness在ARC-AGI 3上达到99%