ベンチマーク · reasoning

ARC-AGI 3

12 結果 7 モデル

ARC Prize's third generation (2026): the agent must learn an unseen interactive game environment from scratch. Scores run far lower than — and are NOT comparable to — the static grid-puzzle ARC-AGI 1/2.

0 25 50 75 100 2026-07-17 2026-08-12 2026-09-07 Schema · 99 · 2026-07-17 Claude Opus 5 · 30.2 · 2026-07-31 GPT‑5.6 Sol · 38.3 · 2026-07-31 GPT‑5.6 Sol · 38.3 · 2026-08-13 Prime Agent · 95.5 · 2026-08-06 Prime Agent · 95.5 · 2026-08-25 Prime Agent · 95.5 · 2026-08-25 GPT-6 Astra · 99.9 · 2026-09-04 GPT-6 Astra · 62.7 · 2026-09-04 Nvidia AVO · 100 · 2026-09-04 GPT‑6 Astra · 99.9 · 2026-09-05 GPT‑6 Astra · 99.9 · 2026-09-07
Schema Claude Opus 5 GPT‑5.6 Sol Prime Agent GPT-6 Astra Nvidia AVO GPT‑6 Astra
タイムライン
日付 モデル スコア ソース
2026-09-07 GPT‑6 Astra 99.9% Claudeがフェルマーの最終定理を証明、OpenAIが自動化研究者を計画
2026-09-05 GPT‑6 Astra 99.9% OpenAI、コンピュータ操作、コーディング、サイバーセキュリティ能力を強化したGPT-6 Astraをリリース
2026-09-04 GPT-6 Astra 62.7% NvidiaがHugging Faceを買収;OpenAIがGPT-6 Astraをリリース;MicrosoftがMAI-Transcribe-2をローンチ
2026-09-04 Nvidia AVO 100.0% Nvidia、AVO ハーネスで ARC AGI-3 で 100% を達成
2026-09-04 GPT-6 Astra 99.9% OpenAIが105万トークンのコンテキストを持つコンピュータ操作モデル「GPT-6 Astra」をリリース
2026-08-25 Prime Agent 95.5% Prime Agent: 自己改善型RLMハルネスがARC-AGI-3 RHAE Best@1を95.5%に引き上げる
2026-08-25 Prime Agent 95.5% Prime Agent: 自己改善型 RLM ハーネスが ARC-AGI-3 RHAE Best@1 を 95.5% に向上
2026-08-13 GPT‑5.6 Sol 38.3% OpenAIが手頃な価格で高性能なエージェントワークフローに対応するGPT-5.6をリリース
2026-08-06 Prime Agent 95.5% PrimeIntellectが自己改善型コーディングハーネス「Prime Agent」をリリース
2026-07-31 GPT‑5.6 Sol 38.3% OpenAI、GPT-5.6 Lunaの価格を80%引き下げ
2026-07-31 Claude Opus 5 30.2% AnthropicがClaude Opus 5をリリース; OpenAIのモデルがセキュリティテスト中にHugging Faceを突破
2026-07-17 Schema 99.0% MoonshotがKimi K3をリリース;Schema harnessがARC-AGI 3で99%を達成