ベンチマーク · reasoning

ARC-AGI 1

27 結果 25 モデル

ARC-AGI 1 は抽象的推論と汎化能力を測ります。各タスクでは入力→出力のグリッド例がいくつか示され、解答者は隠れた変換規則を推測して、新しい入力に対する正しい出力グリッドを作らなければなりません。指標は、出力グリッドが完全に一致して解けたタスクの割合(パーセント)です。

詳しく見る
あるタスクでは2〜3個の小さな色付きグリッドが示され、各入力が同じ規則で出力に変わります——たとえば閉じた領域をすべて塗りつぶす、形を鏡のように反転させるなど——そして、その推測した規則を未見の新しいグリッドに適用します。
採点方法
生成したグリッドが正解と1マスずつ完全に一致したときだけ、そのタスクは解けたと数えられます。最終スコアは評価セット全体で解けたタスクの割合(パーセント)です。
検証方法
判定は自動かつ厳密で、提出された出力グリッドは正解グリッドとマス目ごとに比較され、部分点も人による投票もありません。
重要な理由
これらのパズルは人間には簡単でも、記憶したパターンに頼るモデルには難しくなるよう作られており、知識の想起ではなく本当の抽象化と少数事例からの汎化を試します。そのため、より汎用的なAIへの進歩を測る指標として広く注目されています。
解説付きの例
課題
ARC-AGI 1 は入力→出力のグリッド例をいくつか示し、その後に伏せられたテスト入力を与える。変換規則を推論し、正確な出力グリッドを描く(セルは色 0-9、0=黒)。例は自己フラクタル規則を示す:各 3×3 グリッドは 9×9 に拡大し、セルに色がある位置にはグリッド全体の複製を、0 の位置には空の 3×3 ブロックを配置する。テスト入力(3×3):0 8 0 / 8 8 8 / 0 8 0(色 8 のプラス形)。
解答
0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0 0 8 0 0 8 0 0 8 0 8 8 8 8 8 8 8 8 8 0 8 0 0 8 0 0 8 0 0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0
解説
色 8 のセルはプラスの四辺の中点と中心にある。プラスをちょうどこの 5 つの 3×3 ブロックに配置し(四隅は空のまま)9×9 フラクタルを作る。ARC-AGI はセル単位の完全一致のみを採点し、1 セルでも誤れば不正解、試行は最大 2 回まで。
0 24.5 49 73.5 98 2024-06-17 2025-05-17 2026-04-16 GPT-4o · 50 · 2024-06-17 MindsAI · 55.5 · 2024-12-06 Sonnet 3.5.1 · 53.6 · 2024-12-06 MIT & Cornell team · 47.5 · 2024-12-18 Claude Sonnet 3.5 · 53.6 · 2024-12-18 o3 tuned low · 76 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75 · 2026-04-16 o3-preview (low) · 75.7 · 2025-04-20 o3-preview (high) · 87.5 · 2025-04-20 o3-preview-low · 76 · 2025-04-22 o4-mini-medium · 41 · 2025-04-22 o4-mini-low · 21 · 2025-04-22 o3-medium · 53 · 2025-04-22 o3-low · 41 · 2025-04-22 o3-preview-high · 88 · 2025-04-22 HRM · 32 · 2025-08-15 Grok-4 · 79.6 · 2025-09-16 TRM · 45 · 2025-10-06 Tiny Recursive Model (TRM) · 45 · 2025-12-05 CompressARC · 20 · 2025-12-05 GPT-5.2 Pro · 90.5 · 2025-12-11 GPT-5.2 Thinking · 86.2 · 2025-12-11 Opus 4.6 · 93 · 2026-03-09 OpenAI o3 (low compute) · 75.7 · 2024-12-20 OpenAI o3 (high compute) · 87.5 · 2024-12-20
GPT-4o MindsAI Sonnet 3.5.1 MIT & Cornell team Claude Sonnet 3.5 o3 tuned low o3 o3-preview (low) o3-preview (high) o3-preview-low o4-mini-medium o4-mini-low o3-medium o3-low o3-preview-high HRM Grok-4 TRM Tiny Recursive Model (TRM) CompressARC GPT-5.2 Pro GPT-5.2 Thinking Opus 4.6 OpenAI o3 (low compute) OpenAI o3 (high compute)
タイムライン
日付 モデル スコア ソース
2026-04-16 o3 75.0% GPT-5.2、2025年12月にARC-AGI-2ベンチマークで約53%を達成
2026-03-09 Opus 4.6 93.0% ARC-AGIベンチマークでパフォーマンスが2〜3倍低下、コストは390倍減少
2025-12-11 GPT-5.2 Pro 90.5% OpenAIがGPT-5.2をリリース、コーディングおよび推論ベンチマークでGemini 3を上回る
2025-12-11 GPT-5.2 Thinking 86.2% OpenAI、コード記述・長文脈・推論能力を強化したGPT-5.2を発表
2025-12-05 Tiny Recursive Model (TRM) 45.0% ARC Prize 2025の結果は、AGI進歩の鍵としてリファインメントループを浮き彫りにする
2025-12-05 CompressARC 20.0% ARC Prize 2025の結果は、AGI進歩の鍵としてリファインメントループを浮き彫りにする
2025-10-06 TRM 45.0% Tiny Recursive Model (TRM)は700万パラメータのLLMよりも高いARC-AGI精度を達成
2025-09-16 Grok-4 79.6% Grok-4を用いた英語指示の進化によりARC-AGI v2でSoTAを樹立
2025-08-15 HRM 32.0% HRMのARC-AGIパフォーマンスは外側ループの精緻化と記憶により駆動されているという分析
2025-04-22 o3-preview-low 76.0% ARC Prize FoundationがOpenAI o3およびo4-miniをARC-AGIベンチマークで評価
2025-04-22 o4-mini-medium 41.0% ARC Prize FoundationがOpenAI o3およびo4-miniをARC-AGIベンチマークで評価
2025-04-22 o4-mini-low 21.0% ARC Prize FoundationがOpenAI o3およびo4-miniをARC-AGIベンチマークで評価
2025-04-22 o3-medium 53.0% ARC Prize FoundationがOpenAI o3およびo4-miniをARC-AGIベンチマークで評価
2025-04-22 o3-low 41.0% ARC Prize FoundationがOpenAI o3およびo4-miniをARC-AGIベンチマークで評価
2025-04-22 o3-preview-high 88.0% ARC Prize FoundationがOpenAI o3およびo4-miniをARC-AGIベンチマークで評価
2025-04-20 o3-preview (low) 75.7% OpenAIのo3はFrontierMathで当初主張されたよりも低いスコア
2025-04-20 o3-preview (high) 87.5% OpenAIのo3はFrontierMathで当初主張されたよりも低いスコア
2024-12-20 o3 tuned low 76.0% OpenAI、ARC AGIおよびFrontier Mathでの突破を示すo3推論モデルをプレビュー
2024-12-20 o3 75.7% OpenAI o3がARC-AGI-Pubで画期的なスコアを達成
2024-12-20 o3 75.7% OpenAI、推論とコーディングで高性能なモデルo3をリリース
2024-12-20 OpenAI o3 (low compute) 75.7% ARC Prize
2024-12-20 OpenAI o3 (high compute) 87.5% ARC Prize
2024-12-18 MIT & Cornell team 47.5% ジェレミー・バーマンとMIT/コーネルチームがARC-AGI-Pubで新たな最良結果を達成
2024-12-18 Claude Sonnet 3.5 53.6% ジェレミー・バーマンとMIT/コーネルチームがARC-AGI-Pubで新たな最良結果を達成
2024-12-06 MindsAI 55.5% ARC Prize 2024 の受賞者が発表;ARC-AGI-1 の SOTA が 55.5% に上昇
2024-12-06 Sonnet 3.5.1 53.6% ジェレミー・バーマンがEvolutionary Test-time Computeを用いたSonnet 3.5でARC-AGI-Pubに53.6%を達成
2024-06-17 GPT-4o 50.0% GPT-4oが大規模サンプリングによりARC-AGIで50%のSoTAを達成