Фонд ARC Prize запустил ARC-AGI-2, новый бенчмарк, предназначенный для измерения гибкого интеллекта путем предоставления задач, которые просты для людей, но сложны для современных систем ИИ. Наряду с бенчмарком организация объявила о конкурсе ARC Prize 2025, чтобы стимулировать прогресс в области открытого исходного кода в направлении эффективного общего интеллекта.

ARC-AGI-2 значительно повышает планку сложности по сравнению со своим предшественником: чистые LLM показывают результат 0%, а публичные системы рассуждения достигают лишь однозначных процентов. Бенчмарк состоит из 120 задач на набор для оценки (вместо прежних 100), требующих символической интерпретации, композиционного рассуждения и применения контекстуальных правил. Человеческие участники решили все задачи за два или менее попыток, что подчеркивает разрыв между человеческой адаптивностью и текущими возможностями ИИ.

Инициатива призвана служить ориентиром для исследований AGI, фокусируясь на пробелах в возможностях, которые не возникают при масштабировании, вдохновляя исследователей на разработку новых идей для общего интеллекта.