Benchmark · reasoning

ARC-AGI 2

33 resultados 28 modelos

O ARC-AGI 2 (Abstraction & Reasoning Corpus, versão 2, realizado como ARC Prize 2025) mede o raciocínio fluido: inferir uma regra abstrata a partir de poucos exemplos e aplicá-la a um caso novo. A pontuação é a porcentagem de quebra-cabeças resolvidos corretamente em um conjunto de avaliação reservado e semiprivado.

Saiba mais
Exemplo
Uma tarefa apresenta alguns pares de entrada→saída em grades coloridas (uma pequena grade de células coloridas transformada de uma forma consistente), e quem resolve precisa deduzir a transformação oculta e produzir a grade de saída correta para uma nova entrada.
Pontuação
Cada quebra-cabeça é aprovado ou não: a grade de saída produzida é comparada com a grade correta exata, e a pontuação relatada é a porcentagem de quebra-cabeças resolvidos no conjunto de avaliação semiprivado.
Verificação
Os resultados são verificados automaticamente por correspondência exata da grade de saída — a grade prevista precisa bater com a resposta célula por célula — em um conjunto de teste semiprivado que não é divulgado publicamente para evitar memorização.
Por que importa
Ele foca em quebra-cabeças fáceis para pessoas, mas difíceis para a AI, por isso é uma medida bastante acompanhada de abstração real e raciocínio geral, e não de conhecimento memorizado.
Exemplo resolvido
Tarefa
Quebra-cabeça de grade ARC-AGI-2: deduza a transformação a partir dos pares de treino e depois forneça a grade de saída para a entrada de teste (dígitos 0–9 são cores; 0 = fundo preto). Treino 1: [[4,0,0,0],[0,0,6,0],[4,0,0,0],[0,0,6,0]] → [[0,0,0,0],[0,0,0,0],[4,0,6,0],[4,0,6,0]]. Treino 2: [[0,3,0,0],[0,0,0,8],[0,3,0,0],[0,0,0,0]] → [[0,0,0,0],[0,0,0,0],[0,3,0,0],[0,3,0,8]]. Teste: [[0,0,2,0],[5,0,0,0],[0,0,2,0],[5,0,0,0]] → ?
Solução
[[0, 0, 0, 0], [0, 0, 0, 0], [5, 0, 2, 0], [5, 0, 2, 0]]
Explicação
Cada par de treino mostra uma única regra — a 'gravidade': cada célula colorida cai em linha reta para as células livres mais baixas de sua coluna, mantendo cor e quantidade, enquanto o fundo (0) sobe. No teste, os dois 5 da coluna 0 e os dois 2 da coluna 2 se assentam nas duas linhas de baixo. O ARC-AGI-2 avalia por correspondência exata da grade — dimensões corretas e o valor de cada célula — com pontuação pass@2 em duas tentativas permitidas.
0 25 50 75 100 2024-12-20 2025-10-11 2026-08-03 o3 tuned high · 87 · 2024-12-20 public AI reasoning systems · 9 · 2025-03-24 o4-mini-medium · 3 · 2025-04-22 o4-mini-low · 3 · 2025-04-22 o3-medium · 3 · 2025-04-22 o3-low · 3 · 2025-04-22 Grok 4 · 15.9 · 2025-07-09 Grok 4 · 15.9 · 2025-08-08 HRM · 2 · 2025-08-15 Grok-4 · 29.4 · 2025-09-16 TRM · 8 · 2025-10-06 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 45.1 · 2025-11-18 Gemini 3 Deep Think · 84.6 · 2026-02-12 Gemini 3 Pro (Poetiq refinement) · 54 · 2025-12-05 NVARC (fine-tuned 4B model variant) · 27.6 · 2025-12-05 Poetiq's system (Gemini-based configuration) · 54 · 2025-12-05 Opus 4.5 (Thinking, 64k) · 37.6 · 2025-12-05 Tiny Recursive Model (TRM) · 8 · 2025-12-05 GPT-5.2 Thinking · 52.9 · 2025-12-11 GPT-5.2 Thinking · 52.9 · 2025-12-11 Claude Opus 4.6 · 68.8 · 2026-02-05 Claude Opus 4.6 · 69 · 2026-04-16 Gemini 3.1 Pro · 77.1 · 2026-02-19 Imbue’s Darwinian Evolver · 95.1 · 2026-04-16 Confluence Lab · 97.9 · 2026-04-16 Gemini 3 “Deep Think” · 84.6 · 2026-04-16 GPT-5.4 Pro · 83.3 · 2026-04-16 GPT-5.2 · 53 · 2026-04-16 GPT-5.5 · 85 · 2026-04-25 Gemini 3 Pro · 54 · 2026-07-06 GPT-5.2 Pro · 54.2 · 2026-07-06 Inkling-Small · 40.1 · 2026-08-03
o3 tuned high public AI reasoning systems o4-mini-medium o4-mini-low o3-medium o3-low Grok 4 HRM Grok-4 TRM Gemini 3 Deep Think Gemini 3 Pro (Poetiq refinement) NVARC (fine-tuned 4B model variant) Poetiq's system (Gemini-based configuration) Opus 4.5 (Thinking, 64k) Tiny Recursive Model (TRM) GPT-5.2 Thinking Claude Opus 4.6 Gemini 3.1 Pro Imbue’s Darwinian Evolver Confluence Lab Gemini 3 “Deep Think” GPT-5.4 Pro GPT-5.2 GPT-5.5 Gemini 3 Pro GPT-5.2 Pro Inkling-Small
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-03 Inkling-Small 40.1% Thinking Machines Lab lança Inkling-Small, um modelo MoE multimodal de pesos abertos com 276B
2026-07-06 Gemini 3 Pro 54.0% Busca Orientada por Modalidade com Julgamento Holístico de Traços para ARC-AGI-2
2026-07-06 GPT-5.2 Pro 54.2% Busca Orientada por Modalidade com Julgamento Holístico de Traços para ARC-AGI-2
2026-04-25 GPT-5.5 85.0% OpenAI lança GPT-5.5, um modelo retreinado do zero com processamento omnimodal nativo
2026-04-16 Imbue’s Darwinian Evolver 95.1% GPT-5.2 atinge ~53% no benchmark ARC-AGI-2 em dezembro de 2025
2026-04-16 Confluence Lab 97.9% GPT-5.2 atinge ~53% no benchmark ARC-AGI-2 em dezembro de 2025
2026-04-16 Gemini 3 “Deep Think” 84.6% GPT-5.2 atinge ~53% no benchmark ARC-AGI-2 em dezembro de 2025
2026-04-16 GPT-5.4 Pro 83.3% GPT-5.2 atinge ~53% no benchmark ARC-AGI-2 em dezembro de 2025
2026-04-16 GPT-5.2 53.0% GPT-5.2 atinge ~53% no benchmark ARC-AGI-2 em dezembro de 2025
2026-04-16 Claude Opus 4.6 69.0% GPT-5.2 atinge ~53% no benchmark ARC-AGI-2 em dezembro de 2025
2026-02-19 Gemini 3.1 Pro 77.1% Google lança Gemini 3.1 Pro com raciocínio aprimorado
2026-02-12 Gemini 3 Deep Think 84.6% Google lança Gemini 3 Deep Think atualizado com novas pontuações de benchmarks
2026-02-05 Claude Opus 4.6 68.8% Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI apresenta GPT-5.2 com capacidades aprimoradas de codificação, contexto longo e raciocínio
2025-12-11 GPT-5.2 Thinking 52.9% OpenAI lança GPT-5.2, superando Gemini 3 em benchmarks de codificação e raciocínio
2025-12-05 Gemini 3 Pro (Poetiq refinement) 54.0% Resultados do ARC Prize 2025 destacam loops de refinamento como chave para o progresso da AGI
2025-12-05 NVARC (fine-tuned 4B model variant) 27.64% Pesquisadores da NVIDIA vencem o Kaggle ARC Prize 2025 com raciocínio AGI eficiente em custos
2025-12-05 Poetiq's system (Gemini-based configuration) 54.0% Poetiq alcança 54% no ARC-AGI-2 com metade do custo usando meta-sistema
2025-12-05 Opus 4.5 (Thinking, 64k) 37.6% Resultados do ARC Prize 2025 destacam loops de refinamento como chave para o progresso da AGI
2025-12-05 Tiny Recursive Model (TRM) 8.0% Resultados do ARC Prize 2025 destacam loops de refinamento como chave para o progresso da AGI
2025-11-18 Gemini 3 Deep Think 45.1% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-11-18 Gemini 3 Deep Think 45.1% Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
2025-10-06 TRM 8.0% O Modelo Recursivo Pequeno (TRM) alcança maior precisão no ARC-AGI do que LLMs com 7M de parâmetros
2025-09-16 Grok-4 29.4% ARC-AGI v2 SoTA definido evoluindo instruções em inglês com Grok-4
2025-08-15 HRM 2.0% Análise revela que desempenho do HRM no ARC-AGI é impulsionado por refinamento do loop externo e memorização
2025-08-08 Grok 4 15.9% xAI Grok 4 lidera benchmark Arc-AGI2 com pontuação de 15.9% contra GPT5
2025-07-09 Grok 4 15.9% xAI lança Grok 4 com aprendizado por reforço em escala e uso nativo de ferramentas
2025-04-22 o4-mini-medium 3.0% Fundação ARC Prize avalia modelos o3 e o4-mini da OpenAI nos benchmarks ARC-AGI
2025-04-22 o4-mini-low 3.0% Fundação ARC Prize avalia modelos o3 e o4-mini da OpenAI nos benchmarks ARC-AGI
2025-04-22 o3-medium 3.0% Fundação ARC Prize avalia modelos o3 e o4-mini da OpenAI nos benchmarks ARC-AGI
2025-04-22 o3-low 3.0% Fundação ARC Prize avalia modelos o3 e o4-mini da OpenAI nos benchmarks ARC-AGI
2025-03-24 public AI reasoning systems 9.0% Fundação ARC Prize lança benchmark ARC-AGI-2 e Prêmio ARC 2025
2024-12-20 o3 tuned high 87.0% OpenAI antecipa modelo de raciocínio o3 com avanços no ARC AGI e Frontier Math