Benchmark · math

AIME 2025

31 resultados 27 modelos

O AIME 2025 avalia o raciocínio matemático avançado de um modelo usando os 15 problemas do American Invitational Mathematics Examination de 2025, uma difícil competição do ensino médio. Cada resposta é um número inteiro de 0 a 999, e a pontuação do modelo é a porcentagem de problemas resolvidos corretamente (frequentemente reportada como pass@1 ou avg@k).

Saiba mais
Exemplo
Um item típico é um problema de competição desafiador — por exemplo, de teoria dos números ou combinatória — cuja solução é um único inteiro entre 0 e 999, como encontrar o número de pares ordenados que satisfazem um dado conjunto de condições algébricas.
Pontuação
Cada um dos 15 problemas é avaliado por correspondência exata da resposta inteira, e a pontuação é a fração (porcentagem) resolvida corretamente; como as respostas variam entre execuções, os resultados costumam ser calculados como média de muitas amostras (avg@k) ou reportados como pass@1.
Verificação
A verificação é automática e objetiva: o inteiro final do modelo é comparado com o gabarito oficial, sem crédito parcial e sem julgamento humano, de modo que uma solução só é aceita com correspondência numérica exata.
Por que importa
Os problemas do AIME exigem raciocínio criativo de várias etapas em vez de memorização, por isso esse benchmark é uma medida muito acompanhada da capacidade matemática dos LLMs de fronteira e um número de destaque comum no lançamento de novos modelos de raciocínio.
Exemplo resolvido
Tarefa
Problema representativo no estilo AIME (a resposta é um inteiro de 0 a 999): encontre a soma de todos os inteiros positivos n para os quais √(n² + 85n + 2017) é um inteiro.
Solução
Complete o quadrado: (2m)² − (2n+85)² = 843 = 3·281. Fatore a diferença de quadrados: (2m−2n−85)(2m+2n+85) = 843, o que dá n = 168 ou n = 27. Soma = 168 + 27 = 195.
Explicação
Completar o quadrado transforma a condição em uma diferença de quadrados (2m)² − (2n+85)² = 843 = 3·281, cujas únicas fatorações positivas dão n = 168 e n = 27, somando 195. O AIME é avaliado pela correspondência exata da única resposta inteira (0–999), sem crédito parcial.
0 25 50 75 100 2025-01-22 2025-10-17 2026-07-13 Kimi k1.5 (short-CoT) · 60.8 · 2025-01-22 Kimi k1.5 · 77.5 · 2025-01-22 Grok 3 (Think) · 93.3 · 2025-02-19 Grok 3 Beta · 93.3 · 2025-02-26 OpenAI o3-mini · 83.3 · 2025-02-26 DeepSeek R1 · 79.8 · 2025-02-26 Claude 3.7 Sonnet · 61.3 · 2025-02-26 Claude 3.5 Sonnet · 41.3 · 2025-02-26 Grok 3 · 93.3 · 2025-03-11 Gemini 2.5 Pro (experimental) · 86.7 · 2025-03-25 Gemini 2.5 Pro · 86.7 · 2025-03-26 OpenAI o3 · 98.4 · 2025-04-16 OpenAI o4-mini · 99.5 · 2025-04-16 o4-mini · 92.7 · 2025-04-17 Qwen3-235B-A22B · 81.5 · 2025-05-14 DeepSeek-R1-0528 · 87.5 · 2025-05-28 Deepseek-R1-0528 · 87.5 · 2025-05-30 Grok 4 · 88 · 2025-07-25 Kimi K2 · 49.5 · 2025-07-28 Kimi K2 · 49.5 · 2025-07-28 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GLM-4.6 · 93.9 · 2025-09-30 Claude Sonnet 4.5 · 100 · 2025-09-30 Kimi K2.5 · 96.1 · 2026-01-27 o1-pro · 86 · 2026-05-14 DASH · 50.8 · 2026-07-05 Agents-A1 · 79 · 2026-07-06 Mach-Mind-4-Flash · 92.7 · 2026-07-13 Mach-Mind-4-Flash · 92.7 · 2026-07-13
Kimi k1.5 (short-CoT) Kimi k1.5 Grok 3 (Think) Grok 3 Beta OpenAI o3-mini DeepSeek R1 Claude 3.7 Sonnet Claude 3.5 Sonnet Grok 3 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro OpenAI o3 OpenAI o4-mini o4-mini Qwen3-235B-A22B DeepSeek-R1-0528 Deepseek-R1-0528 Grok 4 Kimi K2 GPT-5 GLM-4.6 Claude Sonnet 4.5 Kimi K2.5 o1-pro DASH Agents-A1 Mach-Mind-4-Flash
Linha do tempo
Data Modelo Pontuação Fonte
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: Modelo agêntico MoE de 35B iguala modelos maiores via otimização pós-treinamento
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: modelo agêntico MoE de 35B iguala modelos maiores por meio de otimização pós-treinamento
2026-07-06 Agents-A1 79.0pts Escalando o Horizonte, Não os Parâmetros: Alcançando Desempenho de Trilhões de Parâmetros com um Agente de 35B
2026-07-05 DASH 50.8% DASH reduz o excesso de raciocínio em modelos de linguagem de raciocínio via atribuição de crédito em nível de segmento
2026-05-14 o1-pro 86.0% OpenAI lança família o1 estabelecendo a era do raciocínio com computação em tempo de inferência
2026-01-27 Kimi K2.5 96.1% Moonshot lança Kimi K2.5 com tecnologia Agent Swarm
2025-09-30 GLM-4.6 93.9% Zhipu AI lança GLM-4.6 com capacidades agênticas e janela de contexto de 128k
2025-09-30 Claude Sonnet 4.5 100.0% Anthropic lança Claude Sonnet 4.5 com capacidades aprimoradas de codificação e agentes
2025-08-07 GPT-5 94.6% OpenAI lança GPT-5 com raciocínio adaptativo e arquitetura unificada
2025-08-07 GPT-5 94.6% OpenAI apresenta GPT-5 com roteamento unificado e raciocínio de nível especialista
2025-08-07 GPT-5 94.6% OpenAI
2025-07-28 Kimi K2 49.5% Kimi K2: modelo MoE aberto com 1T de parâmetros e otimizador MuonClip
2025-07-28 Kimi K2 49.5% Moonshot lança Kimi K2, um modelo MoE agêntico aberto com 32B de parâmetros ativados
2025-07-25 Grok 4 88.0% Epoch AI avalia as capacidades matemáticas do Grok 4
2025-05-30 Deepseek-R1-0528 87.5% DeepSeek atualiza modelo R1 com raciocínio aprimorado e melhores pontuações em benchmarks
2025-05-28 DeepSeek-R1-0528 87.5% DeepSeek-R1-0528 melhora o raciocínio e a precisão no AIME para 87,5%
2025-05-14 Qwen3-235B-A22B 81.5% Qwen3 introduz modo unificado de raciocínio e suporte a 119 idiomas
2025-04-17 o4-mini 92.7% OpenAI lança o4-mini, um modelo de raciocínio multimodal mais rápido e barato
2025-04-16 OpenAI o3 98.4% OpenAI lança modelos de raciocínio o3 e o4-mini com uso agêntico de ferramentas
2025-04-16 OpenAI o4-mini 99.5% OpenAI lança modelos de raciocínio o3 e o4-mini com uso agêntico de ferramentas
2025-03-26 Gemini 2.5 Pro 86.7% Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens
2025-03-25 Gemini 2.5 Pro (experimental) 86.7% Google DeepMind lança modelo experimental Gemini 2.5 Pro
2025-03-11 Grok 3 93.3% xAI lança Grok 3 com raciocínio profundo e contexto de milhão de tokens
2025-02-26 Grok 3 Beta 93.3% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-26 OpenAI o3-mini 83.3% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-26 DeepSeek R1 79.8% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-26 Claude 3.7 Sonnet 61.3% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 41.3% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-19 Grok 3 (Think) 93.3% xAI lança Grok 3 Beta e agente DeepSearch
2025-01-22 Kimi k1.5 (short-CoT) 60.8% Kimi k1.5 escala aprendizado por reforço com LLMs para igualar o1 e superar modelos de CoT curto
2025-01-22 Kimi k1.5 77.5% Kimi k1.5 escala aprendizado por reforço com LLMs para igualar o1 e superar modelos de CoT curto