Benchmark · reasoning

ARC-AGI 1

27 résultats 25 modèles

ARC-AGI 1 mesure le raisonnement abstrait et la généralisation : chaque tâche montre quelques exemples de grilles entrée→sortie, et celui qui résout doit déduire la règle de transformation cachée et produire la bonne grille de sortie pour une nouvelle entrée. La métrique est le pourcentage de tâches résolues avec une grille de sortie exactement identique.

En savoir plus
Exemple
Une tâche peut présenter deux ou trois petites grilles colorées où chaque entrée devient sa sortie selon une même règle — par exemple remplir chaque région fermée ou refléter une forme — et il faut appliquer cette règle déduite à une nouvelle grille jamais vue.
Notation
Une tâche n'est comptée comme résolue que si la grille produite correspond case par case à la réponse de référence ; le score final est la fraction (pourcentage) de tâches résolues sur tout l'ensemble d'évaluation.
Vérification
La vérification est automatique et exacte : la grille de sortie soumise est comparée case par case à la grille correcte, sans crédit partiel ni vote humain.
Pourquoi c'est important
Les énigmes sont conçues pour être faciles pour les humains mais difficiles pour les modèles qui s'appuient sur des motifs mémorisés, si bien que le benchmark évalue une vraie abstraction et une généralisation à partir de peu d'exemples plutôt que des connaissances mémorisées — ce qui en fait une mesure très suivie des progrès vers une IA plus générale.
Exemple résolu
Tâche
ARC-AGI 1 montre quelques démonstrations de grilles entrée→sortie, puis une entrée de test cachée ; vous devez déduire la transformation et dessiner la grille de sortie exacte (les cases sont des couleurs 0-9, 0=noir). Ici les démos révèlent une règle auto-fractale : chaque grille 3×3 s'agrandit en 9×9, en estampant une copie de toute la grille là où une case est colorée et un bloc 3×3 vide là où elle vaut 0. Entrée de test (3×3) : 0 8 0 / 8 8 8 / 0 8 0 (une croix de couleur 8).
Solution
0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0 0 8 0 0 8 0 0 8 0 8 8 8 8 8 8 8 8 8 0 8 0 0 8 0 0 8 0 0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0
Explication
Les cases de couleur 8 se trouvent aux milieux des quatre côtés et au centre de la croix ; estamper la croix exactement dans ces cinq blocs 3×3 (et laisser les quatre coins vides) construit la fractale 9×9. ARC-AGI ne note qu'une correspondance exacte case par case — une seule case fausse échoue la tâche, avec jusqu'à 2 tentatives autorisées.
0 24.5 49 73.5 98 2024-06-17 2025-05-17 2026-04-16 GPT-4o · 50 · 2024-06-17 MindsAI · 55.5 · 2024-12-06 Sonnet 3.5.1 · 53.6 · 2024-12-06 MIT & Cornell team · 47.5 · 2024-12-18 Claude Sonnet 3.5 · 53.6 · 2024-12-18 o3 tuned low · 76 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75 · 2026-04-16 o3-preview (low) · 75.7 · 2025-04-20 o3-preview (high) · 87.5 · 2025-04-20 o3-preview-low · 76 · 2025-04-22 o4-mini-medium · 41 · 2025-04-22 o4-mini-low · 21 · 2025-04-22 o3-medium · 53 · 2025-04-22 o3-low · 41 · 2025-04-22 o3-preview-high · 88 · 2025-04-22 HRM · 32 · 2025-08-15 Grok-4 · 79.6 · 2025-09-16 TRM · 45 · 2025-10-06 Tiny Recursive Model (TRM) · 45 · 2025-12-05 CompressARC · 20 · 2025-12-05 GPT-5.2 Pro · 90.5 · 2025-12-11 GPT-5.2 Thinking · 86.2 · 2025-12-11 Opus 4.6 · 93 · 2026-03-09 OpenAI o3 (low compute) · 75.7 · 2024-12-20 OpenAI o3 (high compute) · 87.5 · 2024-12-20
GPT-4o MindsAI Sonnet 3.5.1 MIT & Cornell team Claude Sonnet 3.5 o3 tuned low o3 o3-preview (low) o3-preview (high) o3-preview-low o4-mini-medium o4-mini-low o3-medium o3-low o3-preview-high HRM Grok-4 TRM Tiny Recursive Model (TRM) CompressARC GPT-5.2 Pro GPT-5.2 Thinking Opus 4.6 OpenAI o3 (low compute) OpenAI o3 (high compute)
Chronologie
Date Modèle Score Source
2026-04-16 o3 75.0% GPT-5.2 atteint ~53 % sur le benchmark ARC-AGI-2 en décembre 2025
2026-03-09 Opus 4.6 93.0% Enquête : chute de performance de 2 à 3 fois sur les benchmarks ARC-AGI malgré une baisse des coûts de 390x
2025-12-11 GPT-5.2 Pro 90.5% OpenAI lance GPT-5.2, surpassant Gemini 3 dans les benchmarks de codage et de raisonnement
2025-12-11 GPT-5.2 Thinking 86.2% OpenAI présente GPT-5.2 avec des capacités de codage, de contexte long et de raisonnement améliorées
2025-12-05 Tiny Recursive Model (TRM) 45.0% Les résultats du Prix ARC 2025 mettent en lumière les boucles de raffinement comme clé des progrès vers l'IAG
2025-12-05 CompressARC 20.0% Les résultats du Prix ARC 2025 mettent en lumière les boucles de raffinement comme clé des progrès vers l'IAG
2025-10-06 TRM 45.0% Le Tiny Recursive Model (TRM) atteint une précision ARC-AGI supérieure aux LLM avec 7 millions de paramètres
2025-09-16 Grok-4 79.6% ARC-AGI v2 SoTA établi en faisant évoluer les instructions en anglais avec Grok-4
2025-08-15 HRM 32.0% L'analyse révèle que la performance d'HRM sur ARC-AGI est pilotée par le raffinement de la boucle externe et la mémorisation
2025-04-22 o3-preview-low 76.0% La fondation ARC Prize évalue les modèles OpenAI o3 et o4-mini sur les benchmarks ARC-AGI
2025-04-22 o4-mini-medium 41.0% La fondation ARC Prize évalue les modèles OpenAI o3 et o4-mini sur les benchmarks ARC-AGI
2025-04-22 o4-mini-low 21.0% La fondation ARC Prize évalue les modèles OpenAI o3 et o4-mini sur les benchmarks ARC-AGI
2025-04-22 o3-medium 53.0% La fondation ARC Prize évalue les modèles OpenAI o3 et o4-mini sur les benchmarks ARC-AGI
2025-04-22 o3-low 41.0% La fondation ARC Prize évalue les modèles OpenAI o3 et o4-mini sur les benchmarks ARC-AGI
2025-04-22 o3-preview-high 88.0% La fondation ARC Prize évalue les modèles OpenAI o3 et o4-mini sur les benchmarks ARC-AGI
2025-04-20 o3-preview (low) 75.7% Les résultats d'o3 d'OpenAI sur FrontierMath sont inférieurs aux affirmations initiales
2025-04-20 o3-preview (high) 87.5% Les résultats d'o3 d'OpenAI sur FrontierMath sont inférieurs aux affirmations initiales
2024-12-20 o3 tuned low 76.0% OpenAI présente en avant-première le modèle de raisonnement o3 avec des percées sur ARC AGI et Frontier Math
2024-12-20 o3 75.7% OpenAI o3 atteint des scores record sur ARC-AGI-Pub
2024-12-20 o3 75.7% OpenAI lance le modèle o3 avec des performances élevées en raisonnement et en codage
2024-12-20 OpenAI o3 (low compute) 75.7% ARC Prize
2024-12-20 OpenAI o3 (high compute) 87.5% ARC Prize
2024-12-18 MIT & Cornell team 47.5% Jeremy Berman et l'équipe MIT/Cornell atteignent un nouvel état de l'art sur ARC-AGI-Pub
2024-12-18 Claude Sonnet 3.5 53.6% Jeremy Berman et l'équipe MIT/Cornell atteignent un nouvel état de l'art sur ARC-AGI-Pub
2024-12-06 MindsAI 55.5% Vainqueurs du ARC Prize 2024 publiés ; le SOTA sur ARC-AGI-1 atteint 55,5 %
2024-12-06 Sonnet 3.5.1 53.6% Jeremy Berman atteint 53,6 % sur ARC-AGI-Pub avec Sonnet 3.5 et un calcul évolutif au moment du test
2024-06-17 GPT-4o 50.0% GPT-4o atteint un SoTA de 50 % sur ARC-AGI par échantillonnage massif