Benchmark · reasoning
ARC-AGI 2
ARC-AGI 2(Abstraction & Reasoning Corpus 第 2 版,以 ARC Prize 2025 的形式举办)衡量流体推理能力:从少量示例中推断出抽象规则,并将其应用到新情形。分数是在保留的半私有评测集上正确解出谜题的百分比。
了解更多
- 示例
- 一道题给出几对彩色网格的输入→输出(一个由彩色格子组成的小网格按某种一致的方式变换),解题者须推断出隐藏的变换规则,并为新的输入生成正确的输出网格。
- 评分方式
- 每道谜题按解出/未解出计分:将生成的输出网格与完全正确的网格比对,最终报告的分数是在半私有评测集上解出谜题的百分比。
- 验证方式
- 结果通过输出网格的精确匹配自动验证——预测网格必须与答案逐格一致——并在不公开发布的半私有测试集上评测,以防止死记硬背。
- 为何重要
- 它聚焦于对人类容易、对 AI 却困难的谜题,因此是衡量真正的抽象与通用推理(而非记忆知识)的一项备受关注的指标。
示例解析
任务
ARC-AGI-2 网格谜题:从训练样例对中推断变换规则,然后给出测试输入对应的输出网格(数字 0–9 代表颜色,0 = 黑色背景)。训练 1:[[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]。训练 2:[[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]。测试:[[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
解答
[[0, 0, 0, 0],
[0, 0, 0, 0],
[5, 0, 2, 0],
[5, 0, 2, 0]]
解析
每个训练样例对都体现同一条规则——“重力”:每个有色格子沿其列竖直下落到该列最底部的空格,颜色和数量保持不变,而背景(0)升到顶部。在测试中,第 0 列的两个 5 和第 2 列的两个 2 落到最下面两行。ARC-AGI-2 按网格完全匹配评分——尺寸正确且每个格子的值都正确——采用 pass@2(允许两次尝试)计分。