La Fondation ARC Prize a lancé ARC-AGI-2, un nouveau benchmark conçu pour mesurer l'intelligence fluide en présentant des tâches faciles pour les humains mais difficiles pour les systèmes d'IA actuels. Parallèlement au benchmark, l'organisation a annoncé le concours ARC Prize 2025 pour stimuler les progrès open-source sur l'intelligence générale efficace.

ARC-AGI-2 augmente considérablement le niveau de difficulté par rapport à son prédécesseur, les LLM purs obtenant 0 % et les systèmes de raisonnement publics atteignant seulement des pourcentages à un chiffre. Le benchmark comprend 120 tâches par ensemble d'évaluation (contre 100 auparavant) qui nécessitent une interprétation symbolique, un raisonnement compositionnel et l'application de règles contextuelles. Les participants humains ont résolu chaque tâche en deux essais ou moins, mettant en évidence l'écart entre l'adaptabilité humaine et les capacités actuelles de l'IA.

L'initiative vise à servir d'étoile du nord pour la recherche sur l'AGI en se concentrant sur les lacunes de capacité qui n'émergent pas de la mise à l'échelle, inspirant les chercheurs à développer des idées novatrices pour l'intelligence générale.