La Fundación ARC Prize ha lanzado ARC-AGI-2, un nuevo benchmark diseñado para medir la inteligencia fluida mediante la presentación de tareas que son fáciles para los humanos pero difíciles para los sistemas actuales de IA. Junto con el benchmark, la organización anunció el concurso ARC Prize 2025 para impulsar el progreso del código abierto en la inteligencia general eficiente.

ARC-AGI-2 eleva significativamente la barra de dificultad en comparación con su predecesor, con LLMs puros obteniendo un 0% y los sistemas de razonamiento públicos alcanzando solo porcentajes de un dígito. El benchmark consta de 120 tareas por conjunto de evaluación (en aumento desde 100) que requieren interpretación simbólica, razonamiento composicional y aplicación de reglas contextuales. Los participantes humanos resolvieron cada tarea en dos intentos o menos, destacando la brecha entre la adaptabilidad humana y las capacidades actuales de la IA.

La iniciativa tiene como objetivo servir como una estrella polar para la investigación de AGI al centrarse en las brechas de capacidad que no emergen del aumento de escala, inspirando a los investigadores a desarrollar ideas novedosas para la inteligencia general.