Benchmark · reasoning

ARC-AGI 1

27 resultados 25 modelos

O ARC-AGI 1 mede o raciocínio abstrato e a generalização: cada tarefa mostra alguns exemplos de grades de entrada→saída, e quem resolve precisa inferir a regra de transformação oculta e produzir a grade de saída correta para uma nova entrada. A métrica é a porcentagem de tarefas resolvidas com uma grade de saída que corresponde exatamente.

Saiba mais
Exemplo
Uma tarefa pode apresentar duas ou três pequenas grades coloridas em que cada entrada vira sua saída por uma mesma regra — por exemplo, preencher cada região fechada ou espelhar uma forma — e você precisa aplicar essa regra inferida a uma grade nova, nunca vista.
Pontuação
Uma tarefa só conta como resolvida quando a grade produzida coincide célula por célula com a resposta de referência; a pontuação final é a fração (porcentagem) de tarefas resolvidas em todo o conjunto de avaliação.
Verificação
A verificação é automática e exata: a grade de saída enviada é comparada célula por célula com a grade correta, sem crédito parcial e sem votação humana.
Por que importa
Os quebra-cabeças são feitos para serem fáceis para pessoas, mas difíceis para modelos que dependem de padrões memorizados, então o benchmark avalia abstração real e generalização com poucos exemplos, e não conhecimento memorizado — o que o torna uma medida bastante acompanhada do progresso rumo a uma IA mais geral.
Exemplo resolvido
Tarefa
O ARC-AGI 1 mostra algumas demonstrações de grades entrada→saída e depois uma entrada de teste reservada; você infere a transformação e desenha a grade de saída exata (as células são cores 0-9, 0=preto). Aqui as demos revelam uma regra autofractal: cada grade 3×3 se expande para 9×9, carimbando uma cópia da grade inteira onde a célula tem cor e um bloco 3×3 vazio onde vale 0. Entrada de teste (3×3): 0 8 0 / 8 8 8 / 0 8 0 (uma cruz na cor 8).
Solução
0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0 0 8 0 0 8 0 0 8 0 8 8 8 8 8 8 8 8 8 0 8 0 0 8 0 0 8 0 0 0 0 0 8 0 0 0 0 0 0 0 8 8 8 0 0 0 0 0 0 0 8 0 0 0 0
Explicação
As células de cor 8 ficam nos pontos médios dos quatro lados e no centro da cruz; carimbar a cruz exatamente nesses cinco blocos 3×3 (e deixar os quatro cantos vazios) constrói o fractal 9×9. O ARC-AGI pontua apenas a correspondência exata célula por célula — uma única célula errada reprova a tarefa, com até 2 tentativas permitidas.
0 24.5 49 73.5 98 2024-06-17 2025-05-17 2026-04-16 GPT-4o · 50 · 2024-06-17 MindsAI · 55.5 · 2024-12-06 Sonnet 3.5.1 · 53.6 · 2024-12-06 MIT & Cornell team · 47.5 · 2024-12-18 Claude Sonnet 3.5 · 53.6 · 2024-12-18 o3 tuned low · 76 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75.7 · 2024-12-20 o3 · 75 · 2026-04-16 o3-preview (low) · 75.7 · 2025-04-20 o3-preview (high) · 87.5 · 2025-04-20 o3-preview-low · 76 · 2025-04-22 o4-mini-medium · 41 · 2025-04-22 o4-mini-low · 21 · 2025-04-22 o3-medium · 53 · 2025-04-22 o3-low · 41 · 2025-04-22 o3-preview-high · 88 · 2025-04-22 HRM · 32 · 2025-08-15 Grok-4 · 79.6 · 2025-09-16 TRM · 45 · 2025-10-06 Tiny Recursive Model (TRM) · 45 · 2025-12-05 CompressARC · 20 · 2025-12-05 GPT-5.2 Pro · 90.5 · 2025-12-11 GPT-5.2 Thinking · 86.2 · 2025-12-11 Opus 4.6 · 93 · 2026-03-09 OpenAI o3 (low compute) · 75.7 · 2024-12-20 OpenAI o3 (high compute) · 87.5 · 2024-12-20
GPT-4o MindsAI Sonnet 3.5.1 MIT & Cornell team Claude Sonnet 3.5 o3 tuned low o3 o3-preview (low) o3-preview (high) o3-preview-low o4-mini-medium o4-mini-low o3-medium o3-low o3-preview-high HRM Grok-4 TRM Tiny Recursive Model (TRM) CompressARC GPT-5.2 Pro GPT-5.2 Thinking Opus 4.6 OpenAI o3 (low compute) OpenAI o3 (high compute)
Linha do tempo
Data Modelo Pontuação Fonte
2026-04-16 o3 75.0% GPT-5.2 atinge ~53% no benchmark ARC-AGI-2 em dezembro de 2025
2026-03-09 Opus 4.6 93.0% Pesquisa revela quedas de desempenho de 2 a 3 vezes nos benchmarks ARC-AGI apesar da queda de custo em 390x
2025-12-11 GPT-5.2 Pro 90.5% OpenAI lança GPT-5.2, superando Gemini 3 em benchmarks de codificação e raciocínio
2025-12-11 GPT-5.2 Thinking 86.2% OpenAI apresenta GPT-5.2 com capacidades aprimoradas de codificação, contexto longo e raciocínio
2025-12-05 Tiny Recursive Model (TRM) 45.0% Resultados do ARC Prize 2025 destacam loops de refinamento como chave para o progresso da AGI
2025-12-05 CompressARC 20.0% Resultados do ARC Prize 2025 destacam loops de refinamento como chave para o progresso da AGI
2025-10-06 TRM 45.0% O Modelo Recursivo Pequeno (TRM) alcança maior precisão no ARC-AGI do que LLMs com 7M de parâmetros
2025-09-16 Grok-4 79.6% ARC-AGI v2 SoTA definido evoluindo instruções em inglês com Grok-4
2025-08-15 HRM 32.0% Análise revela que desempenho do HRM no ARC-AGI é impulsionado por refinamento do loop externo e memorização
2025-04-22 o3-preview-low 76.0% Fundação ARC Prize avalia modelos o3 e o4-mini da OpenAI nos benchmarks ARC-AGI
2025-04-22 o4-mini-medium 41.0% Fundação ARC Prize avalia modelos o3 e o4-mini da OpenAI nos benchmarks ARC-AGI
2025-04-22 o4-mini-low 21.0% Fundação ARC Prize avalia modelos o3 e o4-mini da OpenAI nos benchmarks ARC-AGI
2025-04-22 o3-medium 53.0% Fundação ARC Prize avalia modelos o3 e o4-mini da OpenAI nos benchmarks ARC-AGI
2025-04-22 o3-low 41.0% Fundação ARC Prize avalia modelos o3 e o4-mini da OpenAI nos benchmarks ARC-AGI
2025-04-22 o3-preview-high 88.0% Fundação ARC Prize avalia modelos o3 e o4-mini da OpenAI nos benchmarks ARC-AGI
2025-04-20 o3-preview (low) 75.7% o3 da OpenAI tem pontuação menor no FrontierMath do que inicialmente afirmado
2025-04-20 o3-preview (high) 87.5% o3 da OpenAI tem pontuação menor no FrontierMath do que inicialmente afirmado
2024-12-20 o3 tuned low 76.0% OpenAI antecipa modelo de raciocínio o3 com avanços no ARC AGI e Frontier Math
2024-12-20 o3 75.7% OpenAI o3 alcança pontuações recorde no ARC-AGI-Pub
2024-12-20 o3 75.7% OpenAI lança modelo o3 com alto desempenho em raciocínio e programação
2024-12-20 OpenAI o3 (low compute) 75.7% ARC Prize
2024-12-20 OpenAI o3 (high compute) 87.5% ARC Prize
2024-12-18 MIT & Cornell team 47.5% Jeremy Berman e equipe do MIT/Cornell alcançam novo estado da arte no ARC-AGI-Pub
2024-12-18 Claude Sonnet 3.5 53.6% Jeremy Berman e equipe do MIT/Cornell alcançam novo estado da arte no ARC-AGI-Pub
2024-12-06 MindsAI 55.5% Vencedores do ARC Prize 2024 publicados; SOTA no ARC-AGI-1 sobe para 55,5%
2024-12-06 Sonnet 3.5.1 53.6% Jeremy Berman alcança 53,6% no ARC-AGI-Pub usando Sonnet 3.5 com Computação Evolutiva em Tempo de Teste
2024-06-17 GPT-4o 50.0% GPT-4o alcança SoTA de 50% no ARC-AGI via amostragem massiva