ARC Prize Foundation 发布了 ARC-AGI-2,这是一个旨在通过呈现对人类简单但对当前 AI 系统困难的任务来衡量流体智能的新基准测试。与此同时,该组织宣布了 ARC Prize 2025 竞赛,以推动高效通用智能的开源进展。
与前一版本相比,ARC-AGI-2 显著提高了难度门槛,纯 LLMs 得分为 0%,而公开推理系统的得分仅为个位数百分比。该基准测试每个评估集包含 120 个任务(此前为 100 个),要求具备符号解释、组合推理和上下文规则应用能力。人类参与者均在两次尝试或更少的次数内解决了所有任务,凸显了人类适应性与当前 AI 能力之间的差距。
该举措旨在作为 AGI 研究的北极星,专注于不会因规模扩大而显现的能力差距,激励研究人员为通用智能开发新颖的思路。