ベンチマーク · reasoning

ARC-AGI 2

33 結果 28 モデル

ARC-AGI 2(Abstraction & Reasoning Corpus 第2版、ARC Prize 2025 として実施)は流動的推論を測ります。すなわち、わずかな例から抽象的なルールを推測し、それを新しいケースに適用する能力です。スコアは、非公開に近い(semi-private)評価用データセットで正しく解けたパズルの割合です。

詳しく見る
課題では色付きグリッドの入力→出力のペアがいくつか示され(色付きセルの小さなグリッドが一貫した方法で変換されたもの)、解答者は隠れた変換規則を見抜き、新しい入力に対する正しい出力グリッドを作らなければなりません。
採点方法
各パズルは正解/不正解で採点されます。生成した出力グリッドを完全に正しいグリッドと比較し、報告されるスコアは semi-private 評価セットで解けたパズルの割合です。
検証方法
結果は出力グリッドの完全一致で自動的に検証され(予測したグリッドが答えとマス目単位で一致する必要があります)、丸暗記を防ぐため一般公開されない semi-private のテストセットで評価されます。
重要な理由
人間には簡単でも AI には難しいパズルに焦点を当てているため、暗記した知識ではなく本当の抽象化と汎用的な推論を測る指標として注目されています。
解説付きの例
課題
ARC-AGI-2 のグリッドパズル:訓練ペアから変換規則を推論し、テスト入力に対する出力グリッドを答えてください(数字 0–9 は色、0 = 黒の背景)。訓練 1:[[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]。訓練 2:[[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]。テスト:[[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
解答
[[0, 0, 0, 0], [0, 0, 0, 0], [5, 0, 2, 0], [5, 0, 2, 0]]
解説
どの訓練ペアも同じ規則――「重力」を示している:各色付きセルは列内を真下に落ち、その列の最も下の空きセルに積もり、色と個数は保たれ、背景(0)は上に移動する。テストでは、列 0 の二つの 5 と列 2 の二つの 2 が下から二行に収まる。ARC-AGI-2 はグリッドの完全一致で採点し――寸法が正しく、各セルの値も正しいこと――2 回まで許される pass@2 で評価する。
0 25 50 75 100 2024-12-20 2025-10-11 2026-08-03 o3 tuned high · 87 · 2024-12-20 public AI reasoning systems · 9 · 2025-03-24 o4-mini-medium · 3 · 2025-04-22 o4-mini-low · 3 · 2025-04-22 o3-medium · 3 · 2025-04-22 o3-low · 3 · 2025-04-22 Grok 4 · 15.9 · 2025-07-09 Grok 4 · 15.9 · 2025-08-08 HRM · 2 · 2025-08-15 Grok-4 · 29.4 · 2025-09-16 TRM · 8 · 2025-10-06 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 84.6 · 2026-02-12 Gemini 3 Pro (Poetiq refinement) · 54 · 2025-12-05 NVARC (fine-tuned 4B model variant) · 27.6 · 2025-12-05 Poetiq's system (Gemini-based configuration) · 54 · 2025-12-05 Opus 4.5 (Thinking, 64k) · 37.6 · 2025-12-05 Tiny Recursive Model (TRM) · 8 · 2025-12-05 GPT-5.2 Thinking · 52.9 · 2025-12-11 GPT-5.2 Thinking · 52.9 · 2025-12-11 Claude Opus 4.6 · 68.8 · 2026-02-05 Claude Opus 4.6 · 69 · 2026-04-16 Gemini 3.1 Pro · 77.1 · 2026-02-19 Imbue’s Darwinian Evolver · 95.1 · 2026-04-16 Confluence Lab · 97.9 · 2026-04-16 Gemini 3 “Deep Think” · 84.6 · 2026-04-16 GPT-5.4 Pro · 83.3 · 2026-04-16 GPT-5.2 · 53 · 2026-04-16 GPT-5.5 · 85 · 2026-04-25 Gemini 3 Pro · 54 · 2026-07-06 GPT-5.2 Pro · 54.2 · 2026-07-06 Inkling-Small · 40.1 · 2026-08-03
o3 tuned high public AI reasoning systems o4-mini-medium o4-mini-low o3-medium o3-low Grok 4 HRM Grok-4 TRM Gemini 3 Deep Think Gemini 3 Pro (Poetiq refinement) NVARC (fine-tuned 4B model variant) Poetiq's system (Gemini-based configuration) Opus 4.5 (Thinking, 64k) Tiny Recursive Model (TRM) GPT-5.2 Thinking Claude Opus 4.6 Gemini 3.1 Pro Imbue’s Darwinian Evolver Confluence Lab Gemini 3 “Deep Think” GPT-5.4 Pro GPT-5.2 GPT-5.5 Gemini 3 Pro GPT-5.2 Pro Inkling-Small
タイムライン
日付 モデル スコア ソース
2026-08-03 Inkling-Small 40.1% Thinking Machines Labが276Bのオープンウェイト多モーダルMoEモデルInkling-Smallをリリース
2026-07-06 Gemini 3 Pro 54.0% ARC-AGI-2に対するモーダリティ駆動型検索と包括的トレース判定
2026-07-06 GPT-5.2 Pro 54.2% ARC-AGI-2に対するモーダリティ駆動型検索と包括的トレース判定
2026-04-25 GPT-5.5 85.0% OpenAIがGPT-5.5をリリース、ネイティブオムニモーダル処理を搭載したゼロからの再学習モデル
2026-04-16 Imbue’s Darwinian Evolver 95.1% GPT-5.2、2025年12月にARC-AGI-2ベンチマークで約53%を達成
2026-04-16 Confluence Lab 97.9% GPT-5.2、2025年12月にARC-AGI-2ベンチマークで約53%を達成
2026-04-16 Gemini 3 “Deep Think” 84.6% GPT-5.2、2025年12月にARC-AGI-2ベンチマークで約53%を達成
2026-04-16 GPT-5.4 Pro 83.3% GPT-5.2、2025年12月にARC-AGI-2ベンチマークで約53%を達成
2026-04-16 GPT-5.2 53.0% GPT-5.2、2025年12月にARC-AGI-2ベンチマークで約53%を達成
2026-04-16 Claude Opus 4.6 69.0% GPT-5.2、2025年12月にARC-AGI-2ベンチマークで約53%を達成
2026-02-19 Gemini 3.1 Pro 77.1% Google、推論能力を強化したGemini 3.1 Proをリリース
2026-02-12 Gemini 3 Deep Think 84.6% Google、新しいベンチマークスコアを持つGemini 3 Deep Thinkをリリース
2026-02-05 Claude Opus 4.6 68.8% Anthropicが1Mコンテキストウィンドウとエージェント機能の改善を備えたClaude Opus 4.6をリリース
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI、コード記述・長文脈・推論能力を強化したGPT-5.2を発表
2025-12-11 GPT-5.2 Thinking 52.9% OpenAIがGPT-5.2をリリース、コーディングおよび推論ベンチマークでGemini 3を上回る
2025-12-05 Gemini 3 Pro (Poetiq refinement) 54.0% ARC Prize 2025の結果は、AGI進歩の鍵としてリファインメントループを浮き彫りにする
2025-12-05 NVARC (fine-tuned 4B model variant) 27.64% NVIDIA研究者がコスト効率の良いAGI推論でKaggle ARC Prize 2025を獲得
2025-12-05 Poetiq's system (Gemini-based configuration) 54.0% Poetiqがメタシステムを用いて半分のコストでARC-AGI-2に54%を達成
2025-12-05 Opus 4.5 (Thinking, 64k) 37.6% ARC Prize 2025の結果は、AGI進歩の鍵としてリファインメントループを浮き彫りにする
2025-12-05 Tiny Recursive Model (TRM) 8.0% ARC Prize 2025の結果は、AGI進歩の鍵としてリファインメントループを浮き彫りにする
2025-11-18 Gemini 3 Deep Think 45.1% GoogleがGemini 3 Proをリリース、最先端の推論とマルチモーダル能力を搭載
2025-11-18 Gemini 3 Deep Think 45.1% Google、最先端の推論とマルチモーダル機能を備えたGemini 3 Proをリリース
2025-10-06 TRM 8.0% Tiny Recursive Model (TRM)は700万パラメータのLLMよりも高いARC-AGI精度を達成
2025-09-16 Grok-4 29.4% Grok-4を用いた英語指示の進化によりARC-AGI v2でSoTAを樹立
2025-08-15 HRM 2.0% HRMのARC-AGIパフォーマンスは外側ループの精緻化と記憶により駆動されているという分析
2025-08-08 Grok 4 15.9% xAI Grok 4がArc-AGI2ベンチマークでGPT5を上回る15.9%のスコアで首位
2025-07-09 Grok 4 15.9% xAIがスケーリングされた強化学習とネイティブツール利用を搭載したGrok 4をリリース
2025-04-22 o4-mini-medium 3.0% ARC Prize FoundationがOpenAI o3およびo4-miniをARC-AGIベンチマークで評価
2025-04-22 o4-mini-low 3.0% ARC Prize FoundationがOpenAI o3およびo4-miniをARC-AGIベンチマークで評価
2025-04-22 o3-medium 3.0% ARC Prize FoundationがOpenAI o3およびo4-miniをARC-AGIベンチマークで評価
2025-04-22 o3-low 3.0% ARC Prize FoundationがOpenAI o3およびo4-miniをARC-AGIベンチマークで評価
2025-03-24 public AI reasoning systems 9.0% ARC Prize FoundationがARC-AGI-2ベンチマークとARC Prize 2025を立ち上げ
2024-12-20 o3 tuned high 87.0% OpenAI、ARC AGIおよびFrontier Mathでの突破を示すo3推論モデルをプレビュー