Benchmark · reasoning

ARC-AGI 2

33 resultados 28 modelos

ARC-AGI 2 (Abstraction & Reasoning Corpus, versión 2, realizado como ARC Prize 2025) mide el razonamiento fluido: inferir una regla abstracta a partir de unos pocos ejemplos y aplicarla a un caso nuevo. La puntuación es el porcentaje de acertijos resueltos correctamente en un conjunto de evaluación reservado y semiprivado.

Leer más
Ejemplo
Una tarea muestra unos pocos pares de entrada→salida en cuadrículas de colores (una pequeña cuadrícula de celdas de colores transformada de una forma coherente), y quien resuelve debe deducir la transformación oculta y producir la cuadrícula de salida correcta para una entrada nueva.
Puntuación
Cada acertijo es aprobado o no: la cuadrícula de salida producida se compara con la cuadrícula correcta exacta, y la puntuación informada es el porcentaje de acertijos resueltos en el conjunto de evaluación semiprivado.
Verificación
Los resultados se verifican automáticamente por coincidencia exacta de la cuadrícula de salida —la cuadrícula predicha debe coincidir con la respuesta celda por celda— en un conjunto de prueba semiprivado que no se publica para evitar la memorización.
Por qué importa
Se centra en acertijos fáciles para las personas pero difíciles para la AI, por lo que es una medida muy observada de la abstracción real y el razonamiento general, no del conocimiento memorizado.
Ejemplo resuelto
Tarea
Rompecabezas de rejilla ARC-AGI-2: deduce la transformación a partir de los pares de entrenamiento y luego da la rejilla de salida para la entrada de prueba (los dígitos 0–9 son colores; 0 = fondo negro). Entrenamiento 1: [[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]. Entrenamiento 2: [[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]. Prueba: [[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
Solución
[[0, 0, 0, 0], [0, 0, 0, 0], [5, 0, 2, 0], [5, 0, 2, 0]]
Explicación
Cada par de entrenamiento muestra una sola regla, la 'gravedad': cada celda de color cae en línea recta hacia las celdas libres más bajas de su columna, conservando su color y su cantidad, mientras el fondo (0) sube. En la prueba, los dos 5 de la columna 0 y los dos 2 de la columna 2 se asientan en las dos filas inferiores. ARC-AGI-2 califica por coincidencia exacta de la rejilla —dimensiones correctas y el valor de cada celda— con puntuación pass@2 en dos intentos permitidos.
0 25 50 75 100 2024-12-20 2025-10-11 2026-08-03 o3 tuned high · 87 · 2024-12-20 public AI reasoning systems · 9 · 2025-03-24 o4-mini-medium · 3 · 2025-04-22 o4-mini-low · 3 · 2025-04-22 o3-medium · 3 · 2025-04-22 o3-low · 3 · 2025-04-22 Grok 4 · 15.9 · 2025-07-09 Grok 4 · 15.9 · 2025-08-08 HRM · 2 · 2025-08-15 Grok-4 · 29.4 · 2025-09-16 TRM · 8 · 2025-10-06 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 84.6 · 2026-02-12 Gemini 3 Pro (Poetiq refinement) · 54 · 2025-12-05 NVARC (fine-tuned 4B model variant) · 27.6 · 2025-12-05 Poetiq's system (Gemini-based configuration) · 54 · 2025-12-05 Opus 4.5 (Thinking, 64k) · 37.6 · 2025-12-05 Tiny Recursive Model (TRM) · 8 · 2025-12-05 GPT-5.2 Thinking · 52.9 · 2025-12-11 GPT-5.2 Thinking · 52.9 · 2025-12-11 Claude Opus 4.6 · 68.8 · 2026-02-05 Claude Opus 4.6 · 69 · 2026-04-16 Gemini 3.1 Pro · 77.1 · 2026-02-19 Imbue’s Darwinian Evolver · 95.1 · 2026-04-16 Confluence Lab · 97.9 · 2026-04-16 Gemini 3 “Deep Think” · 84.6 · 2026-04-16 GPT-5.4 Pro · 83.3 · 2026-04-16 GPT-5.2 · 53 · 2026-04-16 GPT-5.5 · 85 · 2026-04-25 Gemini 3 Pro · 54 · 2026-07-06 GPT-5.2 Pro · 54.2 · 2026-07-06 Inkling-Small · 40.1 · 2026-08-03
o3 tuned high public AI reasoning systems o4-mini-medium o4-mini-low o3-medium o3-low Grok 4 HRM Grok-4 TRM Gemini 3 Deep Think Gemini 3 Pro (Poetiq refinement) NVARC (fine-tuned 4B model variant) Poetiq's system (Gemini-based configuration) Opus 4.5 (Thinking, 64k) Tiny Recursive Model (TRM) GPT-5.2 Thinking Claude Opus 4.6 Gemini 3.1 Pro Imbue’s Darwinian Evolver Confluence Lab Gemini 3 “Deep Think” GPT-5.4 Pro GPT-5.2 GPT-5.5 Gemini 3 Pro GPT-5.2 Pro Inkling-Small
Cronología
Fecha Modelo Puntuación Fuente
2026-08-03 Inkling-Small 40.1% Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B
2026-07-06 Gemini 3 Pro 54.0% Búsqueda impulsada por modalidad con juicio holístico de trazas para ARC-AGI-2
2026-07-06 GPT-5.2 Pro 54.2% Búsqueda impulsada por modalidad con juicio holístico de trazas para ARC-AGI-2
2026-04-25 GPT-5.5 85.0% OpenAI lanza GPT-5.5, un modelo reentrenado desde cero con procesamiento omnimodal nativo
2026-04-16 Imbue’s Darwinian Evolver 95.1% GPT-5.2 alcanza ~53% en el benchmark ARC-AGI-2 en diciembre de 2025
2026-04-16 Confluence Lab 97.9% GPT-5.2 alcanza ~53% en el benchmark ARC-AGI-2 en diciembre de 2025
2026-04-16 Gemini 3 “Deep Think” 84.6% GPT-5.2 alcanza ~53% en el benchmark ARC-AGI-2 en diciembre de 2025
2026-04-16 GPT-5.4 Pro 83.3% GPT-5.2 alcanza ~53% en el benchmark ARC-AGI-2 en diciembre de 2025
2026-04-16 GPT-5.2 53.0% GPT-5.2 alcanza ~53% en el benchmark ARC-AGI-2 en diciembre de 2025
2026-04-16 Claude Opus 4.6 69.0% GPT-5.2 alcanza ~53% en el benchmark ARC-AGI-2 en diciembre de 2025
2026-02-19 Gemini 3.1 Pro 77.1% Google lanza Gemini 3.1 Pro con razonamiento mejorado
2026-02-12 Gemini 3 Deep Think 84.6% Google lanza Gemini 3 Deep Think mejorado con nuevas puntuaciones de benchmarks
2026-02-05 Claude Opus 4.6 68.8% Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI presenta GPT-5.2 con capacidades mejoradas de codificación, contexto largo y razonamiento
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI lanza GPT-5.2, superando a Gemini 3 en benchmarks de codificación y razonamiento
2025-12-05 Gemini 3 Pro (Poetiq refinement) 54.0% Los resultados del Premio ARC 2025 destacan los bucles de refinamiento como clave para el progreso hacia la AGI
2025-12-05 NVARC (fine-tuned 4B model variant) 27.64% Investigadores de NVIDIA ganan el Kaggle ARC Prize 2025 con razonamiento AGI eficiente en costos
2025-12-05 Poetiq's system (Gemini-based configuration) 54.0% Poetiq alcanza el 54% en ARC-AGI-2 a la mitad del costo mediante un meta-sistema
2025-12-05 Opus 4.5 (Thinking, 64k) 37.6% Los resultados del Premio ARC 2025 destacan los bucles de refinamiento como clave para el progreso hacia la AGI
2025-12-05 Tiny Recursive Model (TRM) 8.0% Los resultados del Premio ARC 2025 destacan los bucles de refinamiento como clave para el progreso hacia la AGI
2025-11-18 Gemini 3 Deep Think 45.1% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-11-18 Gemini 3 Deep Think 45.1% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-10-06 TRM 8.0% El Modelo Recursivo Pequeño (TRM) logra mayor precisión en ARC-AGI que los LLM con 7M de parámetros
2025-09-16 Grok-4 29.4% ARC-AGI v2 SoTA establecido mediante la evolución de instrucciones en inglés con Grok-4
2025-08-15 HRM 2.0% El análisis revela que el rendimiento de HRM en ARC-AGI está impulsado por el refinamiento del bucle externo y la memorización
2025-08-08 Grok 4 15.9% xAI Grok 4 lidera el benchmark Arc-AGI2 con un puntaje de 15.9% frente a GPT5
2025-07-09 Grok 4 15.9% xAI lanza Grok 4 con aprendizaje por refuerzo escalado y uso nativo de herramientas
2025-04-22 o4-mini-medium 3.0% La Fundación del Premio ARC evalúa los modelos o3 y o4-mini de OpenAI en las pruebas ARC-AGI
2025-04-22 o4-mini-low 3.0% La Fundación del Premio ARC evalúa los modelos o3 y o4-mini de OpenAI en las pruebas ARC-AGI
2025-04-22 o3-medium 3.0% La Fundación del Premio ARC evalúa los modelos o3 y o4-mini de OpenAI en las pruebas ARC-AGI
2025-04-22 o3-low 3.0% La Fundación del Premio ARC evalúa los modelos o3 y o4-mini de OpenAI en las pruebas ARC-AGI
2025-03-24 public AI reasoning systems 9.0% La Fundación ARC Prize lanza el benchmark ARC-AGI-2 y el Premio ARC 2025
2024-12-20 o3 tuned high 87.0% OpenAI presenta el modelo de razonamiento o3 con avances en ARC AGI y Frontier Math