ARC Prize Foundationは、人間には容易だが現在のAIシステムには困難な課題を出題することで流動的知能を測定するために設計された新しいベンチマークであるARC-AGI-2を立ち上げた。ベンチマークと並行して、組織は効率的な汎用知能におけるオープンソースの進展を促進するため、ARC Prize 2025コンペティションを発表した。
ARC-AGI-2は前作と比較して難易度を大幅に引き上げ、純粋なLLMが0%のスコアにとどまる一方、公開された推論システムも一桁のパーセントしか達成していない。このベンチマークは評価セットごとに120の課題で構成されており(従来は100)、記号的解釈、構成的推論、文脈的なルール適用を必要とする。人間参加者はすべての課題を2回以内で解決し、人間の適応力と現在のAI能力の間のギャップを浮き彫りにした。
このイニシアチブは、スケールアップでは生じない能力のギャップに焦点を当てることでAGI研究の指針となることを目指し、研究者が汎用知能のための革新的なアイデアを開発することを促す。