Benchmark · reasoning

ARC-AGI 2

33 résultats 28 modèles

ARC-AGI 2 (Abstraction & Reasoning Corpus, version 2, organisé sous le nom d'ARC Prize 2025) mesure le raisonnement fluide : déduire une règle abstraite à partir de quelques exemples et l'appliquer à un cas nouveau. Le score est le pourcentage d'énigmes résolues correctement sur un jeu d'évaluation réservé et semi-privé.

En savoir plus
Exemple
Une tâche présente quelques paires entrée→sortie sous forme de grilles colorées (une petite grille de cases colorées transformée d'une manière cohérente), et celui qui résout doit deviner la transformation cachée et produire la grille de sortie correcte pour une nouvelle entrée.
Notation
Chaque énigme est réussie ou ratée : la grille de sortie produite est comparée à la grille exacte correcte, et le score rapporté est le pourcentage d'énigmes résolues sur le jeu d'évaluation semi-privé.
Vérification
Les résultats sont vérifiés automatiquement par correspondance exacte de la grille de sortie — la grille prédite doit correspondre à la réponse case par case — sur un jeu de test semi-privé non publié afin d'éviter la mémorisation.
Pourquoi c'est important
Il se concentre sur des énigmes faciles pour les humains mais difficiles pour l'AI, ce qui en fait une mesure très suivie de la véritable abstraction et du raisonnement général, plutôt que des connaissances mémorisées.
Exemple résolu
Tâche
Casse-tête de grille ARC-AGI-2 : déduisez la transformation à partir des paires d'entraînement, puis donnez la grille de sortie pour l'entrée de test (les chiffres 0–9 sont des couleurs ; 0 = fond noir). Entraînement 1 : [[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]. Entraînement 2 : [[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]. Test : [[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
Solution
[[0, 0, 0, 0], [0, 0, 0, 0], [5, 0, 2, 0], [5, 0, 2, 0]]
Explication
Chaque paire d'entraînement illustre une seule règle — la « gravité » : chaque case colorée tombe tout droit vers les cases libres les plus basses de sa colonne, en conservant sa couleur et son nombre, tandis que le fond (0) remonte. Pour le test, les deux 5 de la colonne 0 et les deux 2 de la colonne 2 se posent sur les deux dernières lignes. ARC-AGI-2 note par correspondance exacte de la grille — dimensions correctes et valeur de chaque case — selon un score pass@2 sur deux essais autorisés.
0 25 50 75 100 2024-12-20 2025-10-11 2026-08-03 o3 tuned high · 87 · 2024-12-20 public AI reasoning systems · 9 · 2025-03-24 o4-mini-medium · 3 · 2025-04-22 o4-mini-low · 3 · 2025-04-22 o3-medium · 3 · 2025-04-22 o3-low · 3 · 2025-04-22 Grok 4 · 15.9 · 2025-07-09 Grok 4 · 15.9 · 2025-08-08 HRM · 2 · 2025-08-15 Grok-4 · 29.4 · 2025-09-16 TRM · 8 · 2025-10-06 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 84.6 · 2026-02-12 Gemini 3 Pro (Poetiq refinement) · 54 · 2025-12-05 NVARC (fine-tuned 4B model variant) · 27.6 · 2025-12-05 Poetiq's system (Gemini-based configuration) · 54 · 2025-12-05 Opus 4.5 (Thinking, 64k) · 37.6 · 2025-12-05 Tiny Recursive Model (TRM) · 8 · 2025-12-05 GPT-5.2 Thinking · 52.9 · 2025-12-11 GPT-5.2 Thinking · 52.9 · 2025-12-11 Claude Opus 4.6 · 68.8 · 2026-02-05 Claude Opus 4.6 · 69 · 2026-04-16 Gemini 3.1 Pro · 77.1 · 2026-02-19 Imbue’s Darwinian Evolver · 95.1 · 2026-04-16 Confluence Lab · 97.9 · 2026-04-16 Gemini 3 “Deep Think” · 84.6 · 2026-04-16 GPT-5.4 Pro · 83.3 · 2026-04-16 GPT-5.2 · 53 · 2026-04-16 GPT-5.5 · 85 · 2026-04-25 Gemini 3 Pro · 54 · 2026-07-06 GPT-5.2 Pro · 54.2 · 2026-07-06 Inkling-Small · 40.1 · 2026-08-03
o3 tuned high public AI reasoning systems o4-mini-medium o4-mini-low o3-medium o3-low Grok 4 HRM Grok-4 TRM Gemini 3 Deep Think Gemini 3 Pro (Poetiq refinement) NVARC (fine-tuned 4B model variant) Poetiq's system (Gemini-based configuration) Opus 4.5 (Thinking, 64k) Tiny Recursive Model (TRM) GPT-5.2 Thinking Claude Opus 4.6 Gemini 3.1 Pro Imbue’s Darwinian Evolver Confluence Lab Gemini 3 “Deep Think” GPT-5.4 Pro GPT-5.2 GPT-5.5 Gemini 3 Pro GPT-5.2 Pro Inkling-Small
Chronologie
Date Modèle Score Source
2026-08-03 Inkling-Small 40.1% Thinking Machines Lab publie Inkling-Small, un modèle MoE multimodal à poids ouverts de 276B
2026-07-06 Gemini 3 Pro 54.0% Recherche pilotée par modalité et jugement holistique des traces pour ARC-AGI-2
2026-07-06 GPT-5.2 Pro 54.2% Recherche pilotée par modalité et jugement holistique des traces pour ARC-AGI-2
2026-04-25 GPT-5.5 85.0% OpenAI lance GPT-5.5, un modèle entièrement réentraîné avec traitement omnimodal natif
2026-04-16 Imbue’s Darwinian Evolver 95.1% GPT-5.2 atteint ~53 % sur le benchmark ARC-AGI-2 en décembre 2025
2026-04-16 Confluence Lab 97.9% GPT-5.2 atteint ~53 % sur le benchmark ARC-AGI-2 en décembre 2025
2026-04-16 Gemini 3 “Deep Think” 84.6% GPT-5.2 atteint ~53 % sur le benchmark ARC-AGI-2 en décembre 2025
2026-04-16 GPT-5.4 Pro 83.3% GPT-5.2 atteint ~53 % sur le benchmark ARC-AGI-2 en décembre 2025
2026-04-16 GPT-5.2 53.0% GPT-5.2 atteint ~53 % sur le benchmark ARC-AGI-2 en décembre 2025
2026-04-16 Claude Opus 4.6 69.0% GPT-5.2 atteint ~53 % sur le benchmark ARC-AGI-2 en décembre 2025
2026-02-19 Gemini 3.1 Pro 77.1% Google lance Gemini 3.1 Pro avec des capacités de raisonnement améliorées
2026-02-12 Gemini 3 Deep Think 84.6% Google lance Gemini 3 Deep Think amélioré avec de nouveaux scores de benchmark
2026-02-05 Claude Opus 4.6 68.8% Anthropic lance Claude Opus 4.6 avec une fenêtre de contexte de 1M et des améliorations agentic
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI présente GPT-5.2 avec des capacités de codage, de contexte long et de raisonnement améliorées
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI lance GPT-5.2, surpassant Gemini 3 dans les benchmarks de codage et de raisonnement
2025-12-05 Gemini 3 Pro (Poetiq refinement) 54.0% Les résultats du Prix ARC 2025 mettent en lumière les boucles de raffinement comme clé des progrès vers l'IAG
2025-12-05 NVARC (fine-tuned 4B model variant) 27.64% Les chercheurs de NVIDIA remportent le Kaggle ARC Prize 2025 avec un raisonnement AGI rentable
2025-12-05 Poetiq's system (Gemini-based configuration) 54.0% Poetiq atteint 54% sur ARC-AGI-2 à moitié moins cher grâce à un méta-système
2025-12-05 Opus 4.5 (Thinking, 64k) 37.6% Les résultats du Prix ARC 2025 mettent en lumière les boucles de raffinement comme clé des progrès vers l'IAG
2025-12-05 Tiny Recursive Model (TRM) 8.0% Les résultats du Prix ARC 2025 mettent en lumière les boucles de raffinement comme clé des progrès vers l'IAG
2025-11-18 Gemini 3 Deep Think 45.1% Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-11-18 Gemini 3 Deep Think 45.1% Google lance Gemini 3 Pro avec des capacités de raisonnement et multimodales de pointe
2025-10-06 TRM 8.0% Le Tiny Recursive Model (TRM) atteint une précision ARC-AGI supérieure aux LLM avec 7 millions de paramètres
2025-09-16 Grok-4 29.4% ARC-AGI v2 SoTA établi en faisant évoluer les instructions en anglais avec Grok-4
2025-08-15 HRM 2.0% L'analyse révèle que la performance d'HRM sur ARC-AGI est pilotée par le raffinement de la boucle externe et la mémorisation
2025-08-08 Grok 4 15.9% xAI Grok 4 mène le benchmark Arc-AGI2 avec un score de 15.9% contre GPT5
2025-07-09 Grok 4 15.9% xAI publie Grok 4 avec apprentissage par renforcement à grande échelle et utilisation native d'outils
2025-04-22 o4-mini-medium 3.0% La fondation ARC Prize évalue les modèles OpenAI o3 et o4-mini sur les benchmarks ARC-AGI
2025-04-22 o4-mini-low 3.0% La fondation ARC Prize évalue les modèles OpenAI o3 et o4-mini sur les benchmarks ARC-AGI
2025-04-22 o3-medium 3.0% La fondation ARC Prize évalue les modèles OpenAI o3 et o4-mini sur les benchmarks ARC-AGI
2025-04-22 o3-low 3.0% La fondation ARC Prize évalue les modèles OpenAI o3 et o4-mini sur les benchmarks ARC-AGI
2025-03-24 public AI reasoning systems 9.0% La Fondation ARC Prize lance le benchmark ARC-AGI-2 et le prix ARC 2025
2024-12-20 o3 tuned high 87.0% OpenAI présente en avant-première le modèle de raisonnement o3 avec des percées sur ARC AGI et Frontier Math