A Fundação ARC Prize lançou o ARC-AGI-2, um novo benchmark projetado para medir inteligência fluida por meio de tarefas que são fáceis para humanos, mas difíceis para os sistemas atuais de IA. Junto com o benchmark, a organização anunciou a competição do Prêmio ARC 2025 para impulsionar o progresso de código aberto na inteligência geral eficiente.

O ARC-AGI-2 eleva significativamente a barra de dificuldade em comparação ao seu antecessor, com LLMs puros marcando 0% e sistemas de raciocínio públicos alcançando apenas porcentagens de um dígito. O benchmark consiste em 120 tarefas por conjunto de avaliação (contra 100 anteriores) que exigem interpretação simbólica, raciocínio composicional e aplicação de regras contextuais. Participantes humanos resolveram todas as tarefas em duas tentativas ou menos, destacando a lacuna entre a adaptabilidade humana e as capacidades atuais da IA.

A iniciativa visa servir como uma estrela do norte para a pesquisa de AGI, focando nas lacunas de capacidade que não emergem do aumento de escala, inspirando pesquisadores a desenvolver ideias inovadoras para inteligência geral.