Benchmark · reasoning

ARC-AGI 3

12 results 7 models

ARC Prize's third generation (2026): the agent must learn an unseen interactive game environment from scratch. Scores run far lower than — and are NOT comparable to — the static grid-puzzle ARC-AGI 1/2.

0 25 50 75 100 2026-07-17 2026-08-12 2026-09-07 Schema · 99 · 2026-07-17 Claude Opus 5 · 30.2 · 2026-07-31 GPT‑5.6 Sol · 38.3 · 2026-07-31 GPT‑5.6 Sol · 38.3 · 2026-08-13 Prime Agent · 95.5 · 2026-08-06 Prime Agent · 95.5 · 2026-08-25 Prime Agent · 95.5 · 2026-08-25 GPT-6 Astra · 99.9 · 2026-09-04 GPT-6 Astra · 62.7 · 2026-09-04 Nvidia AVO · 100 · 2026-09-04 GPT‑6 Astra · 99.9 · 2026-09-05 GPT‑6 Astra · 99.9 · 2026-09-07
Schema Claude Opus 5 GPT‑5.6 Sol Prime Agent GPT-6 Astra Nvidia AVO GPT‑6 Astra
Timeline
Date Model Score Source
2026-09-07 GPT‑6 Astra 99.9% Claude proves Fermat's Last Theorem, OpenAI plans automated researcher
2026-09-05 GPT‑6 Astra 99.9% OpenAI releases GPT-6 Astra with improved computer use, coding, and cybersecurity capabilities
2026-09-04 GPT-6 Astra 62.7% Nvidia acquires Hugging Face; OpenAI releases GPT-6 Astra; Microsoft launches MAI-Transcribe-2
2026-09-04 Nvidia AVO 100.0% Nvidia demonstrates 100% on ARC AGI-3 with AVO harness
2026-09-04 GPT-6 Astra 99.9% OpenAI releases GPT-6 Astra, a computer-use model with 1.05M context
2026-08-25 Prime Agent 95.5% Prime Agent: A self-improving RLM harness raises ARC-AGI-3 RHAE Best@1 to 95.5%
2026-08-25 Prime Agent 95.5% Prime Agent: A self-improving RLM harness raises ARC-AGI-3 RHAE Best@1 to 95.5%
2026-08-13 GPT‑5.6 Sol 38.3% OpenAI releases GPT-5.6 for affordable, high-performance agentic workflows
2026-08-06 Prime Agent 95.5% PrimeIntellect releases Prime Agent, a self-improving coding harness
2026-07-31 GPT‑5.6 Sol 38.3% OpenAI reduces GPT-5.6 Luna price by 80 percent
2026-07-31 Claude Opus 5 30.2% Anthropic launches Claude Opus 5; OpenAI models breach Hugging Face during security test
2026-07-17 Schema 99.0% Moonshot launches Kimi K3; Schema harness crushes ARC-AGI 3