Benchmark · reasoning

ARC-AGI 1

27 条结果 25 个模型

ARC-AGI 1 衡量抽象推理与泛化能力:每个任务给出几组「输入→输出」网格示例,解题者必须推断出隐藏的变换规则,并为新的输入生成正确的输出网格。评测指标是输出网格完全匹配的任务所占的百分比。

了解更多
示例
一个任务可能给出两三个小的彩色网格,其中每个输入都按同一条规则变成对应的输出——例如填满每个封闭区域,或把某个形状镜像翻转——你需要把推断出的这条规则应用到一个未见过的新网格上。
评分方式
只有当生成的网格与参考答案逐格完全一致时,该任务才算解出;最终得分是整个评测集中被解出任务的比例(百分比)。
验证方式
评判是自动且精确的:提交的输出网格会与标准答案逐格比对,没有部分得分,也没有人工投票。
为何重要
这些谜题被设计成对人类容易、对依赖记忆模式的模型却很难,因此该基准考察的是真正的抽象能力和少样本泛化,而非知识记忆——这使它成为衡量通用人工智能进展时备受关注的一项测试。
示例解析
任务
ARC-AGI 1 先给出几组输入→输出网格示例,再给一个保留的测试输入;你需要推断出变换规则并精确画出输出网格(格子为颜色 0-9,0=黑色)。示例揭示了一条自分形规则:每个 3×3 网格扩展为 9×9,在有颜色的格子处印上整张网格的副本,在为 0 的格子处放一个空的 3×3 块。测试输入(3×3):0 8 0 / 8 8 8 / 0 8 0(一个颜色为 8 的加号)。
解答
0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0 0 8 0 0 8 0 0 8 0 8 8 8 8 8 8 8 8 8 0 8 0 0 8 0 0 8 0 0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0
解析
颜色 8 的格子位于加号的四条边中点和中心;把加号恰好印到这五个 3×3 块中(四个角留空),就构成 9×9 分形。ARC-AGI 只按逐格完全一致来评分——任何一个格子错误即算失败,最多允许 2 次尝试。
0 24.5 49 73.5 98 2024-06-17 2025-05-17 2026-04-16 GPT-4o · 50 · 2024-06-17 MindsAI · 55.5 · 2024-12-06 Sonnet 3.5.1 · 53.6 · 2024-12-06 MIT & Cornell team · 47.5 · 2024-12-18 Claude Sonnet 3.5 · 53.6 · 2024-12-18 o3 tuned low · 76 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75 · 2026-04-16 o3-preview (low) · 75.7 · 2025-04-20 o3-preview (high) · 87.5 · 2025-04-20 o3-preview-low · 76 · 2025-04-22 o4-mini-medium · 41 · 2025-04-22 o4-mini-low · 21 · 2025-04-22 o3-medium · 53 · 2025-04-22 o3-low · 41 · 2025-04-22 o3-preview-high · 88 · 2025-04-22 HRM · 32 · 2025-08-15 Grok-4 · 79.6 · 2025-09-16 TRM · 45 · 2025-10-06 Tiny Recursive Model (TRM) · 45 · 2025-12-05 CompressARC · 20 · 2025-12-05 GPT-5.2 Pro · 90.5 · 2025-12-11 GPT-5.2 Thinking · 86.2 · 2025-12-11 Opus 4.6 · 93 · 2026-03-09 OpenAI o3 (low compute) · 75.7 · 2024-12-20 OpenAI o3 (high compute) · 87.5 · 2024-12-20
GPT-4o MindsAI Sonnet 3.5.1 MIT & Cornell team Claude Sonnet 3.5 o3 tuned low o3 o3-preview (low) o3-preview (high) o3-preview-low o4-mini-medium o4-mini-low o3-medium o3-low o3-preview-high HRM Grok-4 TRM Tiny Recursive Model (TRM) CompressARC GPT-5.2 Pro GPT-5.2 Thinking Opus 4.6 OpenAI o3 (low compute) OpenAI o3 (high compute)
时间线
日期 模型 得分 来源
2026-04-16 o3 75.0% GPT-5.2在2025年12月ARC-AGI-2基准测试中达到~53%
2026-03-09 Opus 4.6 93.0% 调查显示,尽管成本下降390倍,ARC-AGI基准测试性能仍下降2-3倍
2025-12-11 GPT-5.2 Pro 90.5% OpenAI发布GPT-5.2,在编码和推理基准测试中超越Gemini 3
2025-12-11 GPT-5.2 Thinking 86.2% OpenAI 推出 GPT-5.2,具备改进的代码编写、长上下文和推理能力
2025-12-05 Tiny Recursive Model (TRM) 45.0% ARC Prize 2025 结果凸显迭代优化循环是推进 AGI 的关键
2025-12-05 CompressARC 20.0% ARC Prize 2025 结果凸显迭代优化循环是推进 AGI 的关键
2025-10-06 TRM 45.0% 小型递归模型(TRM)在ARC-AGI上的准确率高于拥有700万参数的大语言模型
2025-09-16 Grok-4 79.6% 通过进化英文指令与Grok-4设定ARC-AGI v2 SoTA
2025-08-15 HRM 32.0% 分析发现HRM的ARC-AGI性能由外循环优化和记忆驱动
2025-04-22 o3-preview-low 76.0% ARC Prize Foundation 在 ARC-AGI 基准上评估 OpenAI o3 和 o4-mini
2025-04-22 o4-mini-medium 41.0% ARC Prize Foundation 在 ARC-AGI 基准上评估 OpenAI o3 和 o4-mini
2025-04-22 o4-mini-low 21.0% ARC Prize Foundation 在 ARC-AGI 基准上评估 OpenAI o3 和 o4-mini
2025-04-22 o3-medium 53.0% ARC Prize Foundation 在 ARC-AGI 基准上评估 OpenAI o3 和 o4-mini
2025-04-22 o3-low 41.0% ARC Prize Foundation 在 ARC-AGI 基准上评估 OpenAI o3 和 o4-mini
2025-04-22 o3-preview-high 88.0% ARC Prize Foundation 在 ARC-AGI 基准上评估 OpenAI o3 和 o4-mini
2025-04-20 o3-preview (low) 75.7% OpenAI的o3在FrontierMath上的得分低于最初声称的水平
2025-04-20 o3-preview (high) 87.5% OpenAI的o3在FrontierMath上的得分低于最初声称的水平
2024-12-20 o3 tuned low 76.0% OpenAI 预览 o3 推理模型,在 ARC AGI 和 Frontier Math 上取得突破
2024-12-20 o3 75.7% OpenAI o3 在 ARC-AGI-Pub 上取得突破性成绩
2024-12-20 o3 75.7% OpenAI 发布 o3 模型,在推理和编程方面表现卓越
2024-12-20 OpenAI o3 (low compute) 75.7% ARC Prize
2024-12-20 OpenAI o3 (high compute) 87.5% ARC Prize
2024-12-18 MIT & Cornell team 47.5% 杰里米·伯曼与MIT/康奈尔团队在ARC-AGI-Pub上创下新纪录
2024-12-18 Claude Sonnet 3.5 53.6% 杰里米·伯曼与MIT/康奈尔团队在ARC-AGI-Pub上创下新纪录
2024-12-06 MindsAI 55.5% ARC Prize 2024 获奖者公布;ARC-AGI-1 上的 SOTA 提升至 55.5%
2024-12-06 Sonnet 3.5.1 53.6% 杰里米·伯曼使用Sonnet 3.5结合进化式测试时计算在ARC-AGI-Pub上取得53.6%的成绩
2024-06-17 GPT-4o 50.0% GPT-4o 通过大规模采样在 ARC-AGI 上达到 50% 的 SoTA