Benchmark · reasoning

ARC-AGI 2

33 条结果 28 个模型

ARC-AGI 2(Abstraction & Reasoning Corpus 第 2 版,以 ARC Prize 2025 的形式举办)衡量流体推理能力:从少量示例中推断出抽象规则,并将其应用到新情形。分数是在保留的半私有评测集上正确解出谜题的百分比。

了解更多
示例
一道题给出几对彩色网格的输入→输出(一个由彩色格子组成的小网格按某种一致的方式变换),解题者须推断出隐藏的变换规则,并为新的输入生成正确的输出网格。
评分方式
每道谜题按解出/未解出计分:将生成的输出网格与完全正确的网格比对,最终报告的分数是在半私有评测集上解出谜题的百分比。
验证方式
结果通过输出网格的精确匹配自动验证——预测网格必须与答案逐格一致——并在不公开发布的半私有测试集上评测,以防止死记硬背。
为何重要
它聚焦于对人类容易、对 AI 却困难的谜题,因此是衡量真正的抽象与通用推理(而非记忆知识)的一项备受关注的指标。
示例解析
任务
ARC-AGI-2 网格谜题:从训练样例对中推断变换规则,然后给出测试输入对应的输出网格(数字 0–9 代表颜色,0 = 黑色背景)。训练 1:[[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]。训练 2:[[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]。测试:[[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
解答
[[0, 0, 0, 0], [0, 0, 0, 0], [5, 0, 2, 0], [5, 0, 2, 0]]
解析
每个训练样例对都体现同一条规则——“重力”:每个有色格子沿其列竖直下落到该列最底部的空格,颜色和数量保持不变,而背景(0)升到顶部。在测试中,第 0 列的两个 5 和第 2 列的两个 2 落到最下面两行。ARC-AGI-2 按网格完全匹配评分——尺寸正确且每个格子的值都正确——采用 pass@2(允许两次尝试)计分。
0 25 50 75 100 2024-12-20 2025-10-11 2026-08-03 o3 tuned high · 87 · 2024-12-20 public AI reasoning systems · 9 · 2025-03-24 o4-mini-medium · 3 · 2025-04-22 o4-mini-low · 3 · 2025-04-22 o3-medium · 3 · 2025-04-22 o3-low · 3 · 2025-04-22 Grok 4 · 15.9 · 2025-07-09 Grok 4 · 15.9 · 2025-08-08 HRM · 2 · 2025-08-15 Grok-4 · 29.4 · 2025-09-16 TRM · 8 · 2025-10-06 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 84.6 · 2026-02-12 Gemini 3 Pro (Poetiq refinement) · 54 · 2025-12-05 NVARC (fine-tuned 4B model variant) · 27.6 · 2025-12-05 Poetiq's system (Gemini-based configuration) · 54 · 2025-12-05 Opus 4.5 (Thinking, 64k) · 37.6 · 2025-12-05 Tiny Recursive Model (TRM) · 8 · 2025-12-05 GPT-5.2 Thinking · 52.9 · 2025-12-11 GPT-5.2 Thinking · 52.9 · 2025-12-11 Claude Opus 4.6 · 68.8 · 2026-02-05 Claude Opus 4.6 · 69 · 2026-04-16 Gemini 3.1 Pro · 77.1 · 2026-02-19 Imbue’s Darwinian Evolver · 95.1 · 2026-04-16 Confluence Lab · 97.9 · 2026-04-16 Gemini 3 “Deep Think” · 84.6 · 2026-04-16 GPT-5.4 Pro · 83.3 · 2026-04-16 GPT-5.2 · 53 · 2026-04-16 GPT-5.5 · 85 · 2026-04-25 Gemini 3 Pro · 54 · 2026-07-06 GPT-5.2 Pro · 54.2 · 2026-07-06 Inkling-Small · 40.1 · 2026-08-03
o3 tuned high public AI reasoning systems o4-mini-medium o4-mini-low o3-medium o3-low Grok 4 HRM Grok-4 TRM Gemini 3 Deep Think Gemini 3 Pro (Poetiq refinement) NVARC (fine-tuned 4B model variant) Poetiq's system (Gemini-based configuration) Opus 4.5 (Thinking, 64k) Tiny Recursive Model (TRM) GPT-5.2 Thinking Claude Opus 4.6 Gemini 3.1 Pro Imbue’s Darwinian Evolver Confluence Lab Gemini 3 “Deep Think” GPT-5.4 Pro GPT-5.2 GPT-5.5 Gemini 3 Pro GPT-5.2 Pro Inkling-Small
时间线
日期 模型 得分 来源
2026-08-03 Inkling-Small 40.1% Thinking Machines Lab 发布 Inkling-Small,一款拥有 276B 开放权重的多模态 MoE 模型
2026-07-06 Gemini 3 Pro 54.0% 用于 ARC-AGI-2 的模态驱动搜索与整体轨迹评判
2026-07-06 GPT-5.2 Pro 54.2% 用于 ARC-AGI-2 的模态驱动搜索与整体轨迹评判
2026-04-25 GPT-5.5 85.0% OpenAI发布GPT-5.5,一款从头重新训练、原生支持全模态处理的模型
2026-04-16 Imbue’s Darwinian Evolver 95.1% GPT-5.2在2025年12月ARC-AGI-2基准测试中达到~53%
2026-04-16 Confluence Lab 97.9% GPT-5.2在2025年12月ARC-AGI-2基准测试中达到~53%
2026-04-16 Gemini 3 “Deep Think” 84.6% GPT-5.2在2025年12月ARC-AGI-2基准测试中达到~53%
2026-04-16 GPT-5.4 Pro 83.3% GPT-5.2在2025年12月ARC-AGI-2基准测试中达到~53%
2026-04-16 GPT-5.2 53.0% GPT-5.2在2025年12月ARC-AGI-2基准测试中达到~53%
2026-04-16 Claude Opus 4.6 69.0% GPT-5.2在2025年12月ARC-AGI-2基准测试中达到~53%
2026-02-19 Gemini 3.1 Pro 77.1% Google发布Gemini 3.1 Pro,推理能力增强
2026-02-12 Gemini 3 Deep Think 84.6% Google 发布升级版 Gemini 3 Deep Think,附带新的基准测试成绩
2026-02-05 Claude Opus 4.6 68.8% Anthropic 发布 Claude Opus 4.6,具备 1M 上下文窗口和智能体改进
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI 推出 GPT-5.2,具备改进的代码编写、长上下文和推理能力
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI发布GPT-5.2,在编码和推理基准测试中超越Gemini 3
2025-12-05 Gemini 3 Pro (Poetiq refinement) 54.0% ARC Prize 2025 结果凸显迭代优化循环是推进 AGI 的关键
2025-12-05 NVARC (fine-tuned 4B model variant) 27.64% NVIDIA研究人员以高性价比AGI推理赢得Kaggle ARC Prize 2025
2025-12-05 Poetiq's system (Gemini-based configuration) 54.0% Poetiq 利用元系统以一半成本在 ARC-AGI-2 上取得 54% 的成绩
2025-12-05 Opus 4.5 (Thinking, 64k) 37.6% ARC Prize 2025 结果凸显迭代优化循环是推进 AGI 的关键
2025-12-05 Tiny Recursive Model (TRM) 8.0% ARC Prize 2025 结果凸显迭代优化循环是推进 AGI 的关键
2025-11-18 Gemini 3 Deep Think 45.1% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-11-18 Gemini 3 Deep Think 45.1% Google 发布 Gemini 3 Pro,具备最先进的推理和多模态能力
2025-10-06 TRM 8.0% 小型递归模型(TRM)在ARC-AGI上的准确率高于拥有700万参数的大语言模型
2025-09-16 Grok-4 29.4% 通过进化英文指令与Grok-4设定ARC-AGI v2 SoTA
2025-08-15 HRM 2.0% 分析发现HRM的ARC-AGI性能由外循环优化和记忆驱动
2025-08-08 Grok 4 15.9% xAI Grok 4在Arc-AGI2基准测试中以15.9%的得分领先于GPT5
2025-07-09 Grok 4 15.9% xAI 发布 Grok 4,采用扩展强化学习与原生工具调用
2025-04-22 o4-mini-medium 3.0% ARC Prize Foundation 在 ARC-AGI 基准上评估 OpenAI o3 和 o4-mini
2025-04-22 o4-mini-low 3.0% ARC Prize Foundation 在 ARC-AGI 基准上评估 OpenAI o3 和 o4-mini
2025-04-22 o3-medium 3.0% ARC Prize Foundation 在 ARC-AGI 基准上评估 OpenAI o3 和 o4-mini
2025-04-22 o3-low 3.0% ARC Prize Foundation 在 ARC-AGI 基准上评估 OpenAI o3 和 o4-mini
2025-03-24 public AI reasoning systems 9.0% ARC Prize Foundation 发布 ARC-AGI-2 基准测试和 ARC Prize 2025
2024-12-20 o3 tuned high 87.0% OpenAI 预览 o3 推理模型,在 ARC AGI 和 Frontier Math 上取得突破