Benchmark · reasoning

ARC-AGI 1

28 resultados 26 modelos

ARC-AGI 1 mide el razonamiento abstracto y la generalización: cada tarea muestra unos pocos ejemplos de cuadrículas de entrada→salida, y quien resuelve debe inferir la regla de transformación oculta y producir la cuadrícula de salida correcta para una nueva entrada. La métrica es el porcentaje de tareas resueltas con una cuadrícula de salida que coincide exactamente.

Leer más
Ejemplo
Una tarea puede presentar dos o tres pequeñas cuadrículas de colores donde cada entrada se convierte en su salida siguiendo una misma regla —por ejemplo, rellenar cada región cerrada o reflejar una figura— y hay que aplicar esa regla inferida a una cuadrícula nueva que no se ha visto.
Puntuación
Una tarea cuenta como resuelta solo si la cuadrícula producida coincide celda por celda con la respuesta de referencia; la puntuación final es la fracción (porcentaje) de tareas resueltas en todo el conjunto de evaluación.
Verificación
La comprobación es automática y exacta: la cuadrícula de salida enviada se compara celda por celda con la cuadrícula correcta, sin crédito parcial ni votación humana.
Por qué importa
Los acertijos están diseñados para ser fáciles para las personas pero difíciles para los modelos que dependen de patrones memorizados, así que el benchmark evalúa la abstracción real y la generalización con pocos ejemplos en lugar del conocimiento memorizado, lo que lo convierte en una medida muy seguida del progreso hacia una IA más general.
Ejemplo resuelto
Tarea
ARC-AGI 1 muestra unas pocas demostraciones de rejillas entrada→salida y luego una entrada de prueba oculta; debes inferir la transformación y dibujar la rejilla de salida exacta (las celdas son colores 0-9, 0=negro). Aquí las demos revelan una regla autofractal: cada rejilla 3×3 se expande a 9×9, estampando una copia de toda la rejilla donde una celda tiene color y un bloque 3×3 vacío donde vale 0. Entrada de prueba (3×3): 0 8 0 / 8 8 8 / 0 8 0 (una cruz de color 8).
Solución
0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0 0 8 0 0 8 0 0 8 0 8 8 8 8 8 8 8 8 8 0 8 0 0 8 0 0 8 0 0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0
Explicación
Las celdas de color 8 están en los puntos medios de los cuatro lados y en el centro de la cruz; estampar la cruz exactamente en esos cinco bloques 3×3 (y dejar vacías las cuatro esquinas) construye el fractal 9×9. ARC-AGI puntúa solo una coincidencia exacta celda por celda: una sola celda equivocada falla la tarea, con hasta 2 intentos permitidos.
0 24.5 49 73.5 98 2024-06-17 2025-06-22 2026-06-27 GPT-4o · 50 · 2024-06-17 MindsAI · 55.5 · 2024-12-06 Sonnet 3.5.1 · 53.6 · 2024-12-06 MIT & Cornell team · 47.5 · 2024-12-18 Claude Sonnet 3.5 · 53.6 · 2024-12-18 o3 tuned low · 76 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75 · 2026-04-16 o3-preview (low) · 75.7 · 2025-04-20 o3-preview (high) · 87.5 · 2025-04-20 o3-preview-low · 76 · 2025-04-22 o4-mini-medium · 41 · 2025-04-22 o4-mini-low · 21 · 2025-04-22 o3-low · 41 · 2025-04-22 o3-medium · 53 · 2025-04-22 o3-preview-high · 88 · 2025-04-22 HRM · 32 · 2025-08-15 Grok-4 · 79.6 · 2025-09-16 TRM · 45 · 2025-10-06 Tiny Recursive Model (TRM) · 45 · 2025-12-05 CompressARC · 20 · 2025-12-05 GPT-5.2 Thinking · 86.2 · 2025-12-11 GPT-5.2 Pro · 90.5 · 2025-12-11 Opus 4.6 · 93 · 2026-03-09 iLLaDA-Base · 14.9 · 2026-06-27 OpenAI o3 (low compute) · 75.7 · 2024-12-20 OpenAI o3 (high compute) · 87.5 · 2024-12-20
GPT-4o MindsAI Sonnet 3.5.1 MIT & Cornell team Claude Sonnet 3.5 o3 tuned low o3 o3-preview (low) o3-preview (high) o3-preview-low o4-mini-medium o4-mini-low o3-low o3-medium o3-preview-high HRM Grok-4 TRM Tiny Recursive Model (TRM) CompressARC GPT-5.2 Thinking GPT-5.2 Pro Opus 4.6 iLLaDA-Base OpenAI o3 (low compute) OpenAI o3 (high compute)
Cronología
Fecha Modelo Puntuación Fuente
2026-06-27 iLLaDA-Base 14.9pts iLLaDA: Un modelo de lenguaje de difusión enmascarado de 8B con atención totalmente bidireccional
2026-04-16 o3 75.0% GPT-5.2 alcanza ~53% en el benchmark ARC-AGI-2 en diciembre de 2025
2026-03-09 Opus 4.6 93.0% Encuesta revela caídas de rendimiento de 2-3x en benchmarks ARC-AGI a pesar de que los costos bajan 390x
2025-12-11 GPT-5.2 Thinking 86.2% OpenAI presenta GPT-5.2 con capacidades mejoradas de codificación, contexto largo y razonamiento
2025-12-11 GPT-5.2 Pro 90.5% OpenAI lanza GPT-5.2, superando a Gemini 3 en benchmarks de codificación y razonamiento
2025-12-05 Tiny Recursive Model (TRM) 45.0% Los resultados del Premio ARC 2025 destacan los bucles de refinamiento como clave para el progreso hacia la AGI
2025-12-05 CompressARC 20.0% Los resultados del Premio ARC 2025 destacan los bucles de refinamiento como clave para el progreso hacia la AGI
2025-10-06 TRM 45.0% El Modelo Recursivo Pequeño (TRM) logra mayor precisión en ARC-AGI que los LLM con 7M de parámetros
2025-09-16 Grok-4 79.6% ARC-AGI v2 SoTA establecido mediante la evolución de instrucciones en inglés con Grok-4
2025-08-15 HRM 32.0% El análisis revela que el rendimiento de HRM en ARC-AGI está impulsado por el refinamiento del bucle externo y la memorización
2025-04-22 o3-preview-low 76.0% La Fundación del Premio ARC evalúa los modelos o3 y o4-mini de OpenAI en las pruebas ARC-AGI
2025-04-22 o4-mini-medium 41.0% La Fundación del Premio ARC evalúa los modelos o3 y o4-mini de OpenAI en las pruebas ARC-AGI
2025-04-22 o4-mini-low 21.0% La Fundación del Premio ARC evalúa los modelos o3 y o4-mini de OpenAI en las pruebas ARC-AGI
2025-04-22 o3-low 41.0% La Fundación del Premio ARC evalúa los modelos o3 y o4-mini de OpenAI en las pruebas ARC-AGI
2025-04-22 o3-medium 53.0% La Fundación del Premio ARC evalúa los modelos o3 y o4-mini de OpenAI en las pruebas ARC-AGI
2025-04-22 o3-preview-high 88.0% La Fundación del Premio ARC evalúa los modelos o3 y o4-mini de OpenAI en las pruebas ARC-AGI
2025-04-20 o3-preview (low) 75.7% El o3 de OpenAI obtiene una puntuación más baja en FrontierMath de lo inicialmente afirmado
2025-04-20 o3-preview (high) 87.5% El o3 de OpenAI obtiene una puntuación más baja en FrontierMath de lo inicialmente afirmado
2024-12-20 o3 tuned low 76.0% OpenAI presenta el modelo de razonamiento o3 con avances en ARC AGI y Frontier Math
2024-12-20 o3 75.7% OpenAI o3 alcanza puntuaciones récord en ARC-AGI-Pub
2024-12-20 o3 75.7% OpenAI lanza el modelo o3 con alto rendimiento en razonamiento y programación
2024-12-20 OpenAI o3 (low compute) 75.7% ARC Prize
2024-12-20 OpenAI o3 (high compute) 87.5% ARC Prize
2024-12-18 MIT & Cornell team 47.5% Jeremy Berman y el equipo de MIT/Cornell logran un nuevo estado del arte en ARC-AGI-Pub
2024-12-18 Claude Sonnet 3.5 53.6% Jeremy Berman y el equipo de MIT/Cornell logran un nuevo estado del arte en ARC-AGI-Pub
2024-12-06 MindsAI 55.5% Se publican los ganadores del ARC Prize 2024; el SOTA en ARC-AGI-1 alcanza el 55,5%
2024-12-06 Sonnet 3.5.1 53.6% Jeremy Berman alcanza 53,6 % en ARC-AGI-Pub usando Sonnet 3.5 con Cómputo Evolutivo en Tiempo de Prueba
2024-06-17 GPT-4o 50.0% GPT-4o alcanza un SoTA del 50% en ARC-AGI mediante muestreo masivo