Benchmark · reasoning
ARC-AGI 1
ARC-AGI 1 衡量抽象推理与泛化能力:每个任务给出几组「输入→输出」网格示例,解题者必须推断出隐藏的变换规则,并为新的输入生成正确的输出网格。评测指标是输出网格完全匹配的任务所占的百分比。
了解更多
- 示例
- 一个任务可能给出两三个小的彩色网格,其中每个输入都按同一条规则变成对应的输出——例如填满每个封闭区域,或把某个形状镜像翻转——你需要把推断出的这条规则应用到一个未见过的新网格上。
- 评分方式
- 只有当生成的网格与参考答案逐格完全一致时,该任务才算解出;最终得分是整个评测集中被解出任务的比例(百分比)。
- 验证方式
- 评判是自动且精确的:提交的输出网格会与标准答案逐格比对,没有部分得分,也没有人工投票。
- 为何重要
- 这些谜题被设计成对人类容易、对依赖记忆模式的模型却很难,因此该基准考察的是真正的抽象能力和少样本泛化,而非知识记忆——这使它成为衡量通用人工智能进展时备受关注的一项测试。
示例解析
任务
ARC-AGI 1 先给出几组输入→输出网格示例,再给一个保留的测试输入;你需要推断出变换规则并精确画出输出网格(格子为颜色 0-9,0=黑色)。示例揭示了一条自分形规则:每个 3×3 网格扩展为 9×9,在有颜色的格子处印上整张网格的副本,在为 0 的格子处放一个空的 3×3 块。测试输入(3×3):
0 8 0 / 8 8 8 / 0 8 0(一个颜色为 8 的加号)。解答
0 0 0 0 8 0 0 0 0
0 0 0 8 8 8 0 0 0
0 0 0 0 8 0 0 0 0
0 8 0 0 8 0 0 8 0
8 8 8 8 8 8 8 8 8
0 8 0 0 8 0 0 8 0
0 0 0 0 8 0 0 0 0
0 0 0 8 8 8 0 0 0
0 0 0 0 8 0 0 0 0
解析
颜色 8 的格子位于加号的四条边中点和中心;把加号恰好印到这五个 3×3 块中(四个角留空),就构成 9×9 分形。ARC-AGI 只按逐格完全一致来评分——任何一个格子错误即算失败,最多允许 2 次尝试。