Benchmark · math

AIME 2024

30 resultados 27 modelos

AIME 2024 mede o raciocínio matemático avançado de um modelo usando os 15 problemas do American Invitational Mathematics Examination de 2024 e informa a porcentagem resolvida corretamente.

Saiba mais
Exemplo
Um item típico é um problema difícil de olimpíada escolar — por exemplo, de teoria dos números ou combinatória — cuja resposta é um único número inteiro (no AIME a resposta é sempre um inteiro, normalmente de 0 a 999).
Pontuação
A métrica é a acurácia: a proporção dos 15 problemas respondidos corretamente, de modo que cada problema resolvido vale 1/15 da pontuação.
Verificação
O resultado é aceito por correspondência exata: o número inteiro final do modelo precisa ser igual à resposta oficial, verificado automaticamente, sem pontuação parcial e sem avaliação humana.
Por que importa
Por ser um conjunto compacto de problemas de competição difíceis e recentes que exigem raciocínio de várias etapas, é muito usado para comparar modelos de fronteira, e sua novidade reduz a contaminação dos dados de treino.
Exemplo resolvido
Tarefa
Quantos inteiros positivos n ≤ 600 são divisíveis por 4 ou por 6, mas não por 5? (As respostas do AIME são inteiros de 0 a 999.)
Solução
Multiples of 4 or 6 that are ≤ 600: 150 + 100 − 50 = 200. Of these, the ones also divisible by 5 (multiples of 20 or 30, minus 60): 30 + 20 − 10 = 40. Answer: 200 − 40 = 160.
Explicação
Por inclusão-exclusão, 200 inteiros são divisíveis por 4 ou 6, e 40 deles também por 5, restando 160. O AIME corrige automaticamente apenas o inteiro final (0–999), sem crédito parcial pelo desenvolvimento.
0 25 50 75 100 2024-09-12 2025-08-09 2026-07-07 o1 · 13.9 · 2024-09-12 OpenAI o1-preview · 83 · 2024-10-01 QwQ-32B-Preview · 50 · 2024-11-28 o3 · 96.7 · 2024-12-20 o3 · 96.7 · 2026-03-25 DeepSeek-R1-Distill-Qwen-7B · 55.5 · 2025-01-22 DeepSeek-R1-Zero · 71 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 72.6 · 2025-01-22 DeepSeek-R1 · 79.8 · 2025-01-22 s1-32B · 57 · 2025-01-31 s1-32B · 57 · 2025-01-31 LIMO · 57.1 · 2025-02-05 Grok 3 mini · 95.8 · 2025-02-19 Claude 3.7 Sonnet · 80 · 2025-02-24 GPT-4.5 · 36.7 · 2025-03-05 DeepSeek-V3-0324 · 59.4 · 2025-03-24 Gemini 2.5 Pro · 92 · 2025-03-26 Seed1.5-Thinking · 86.7 · 2025-04-10 o4-mini · 93.4 · 2025-04-17 Qwen3-235B-A22B · 85.7 · 2025-05-14 Deepseek-R1-0528-Qwen3-8B · 86 · 2025-05-30 Deepseek-R1-0528 · 91.4 · 2025-05-30 Magistral Small · 70.7 · 2025-06-10 Magistral Medium · 73.6 · 2025-06-10 Magistral Medium · 50 · 2025-06-12 GLM-4.5 · 91 · 2025-08-06 GLM-4.5-Air · 89.4 · 2025-08-06 Qwen3-1.7B · 62.4 · 2026-07-07 DeepSeek R1 · 79.8 · 2025-01-20 OpenAI o3 · 91.6 · 2025-04-16
o1 OpenAI o1-preview QwQ-32B-Preview o3 DeepSeek-R1-Distill-Qwen-7B DeepSeek-R1-Zero DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 s1-32B LIMO Grok 3 mini Claude 3.7 Sonnet GPT-4.5 DeepSeek-V3-0324 Gemini 2.5 Pro Seed1.5-Thinking o4-mini Qwen3-235B-A22B Deepseek-R1-0528-Qwen3-8B Deepseek-R1-0528 Magistral Small Magistral Medium GLM-4.5 GLM-4.5-Air Qwen3-1.7B DeepSeek R1 OpenAI o3
Linha do tempo
Data Modelo Pontuação Fonte
2026-07-07 Qwen3-1.7B 62.4% Direct-OPD destila ganhos de RL fraco-para-forte para modelos mais fortes
2026-03-25 o3 96.7% OpenAI anuncia a aposentadoria do o3 do ChatGPT e compartilha pontuações de benchmarks
2025-08-06 GLM-4.5 91.0% Zhipu AI lança modelos GLM-4.5 que igualam Claude e DeepSeek
2025-08-06 GLM-4.5-Air 89.4% Zhipu AI lança modelos GLM-4.5 que igualam Claude e DeepSeek
2025-06-12 Magistral Medium 50.0% Mistral apresenta modelos de raciocínio Magistral com pipeline de RL escalável
2025-06-10 Magistral Small 70.7% Mistral AI lança modelo de raciocínio Magistral com versões aberta e empresarial
2025-06-10 Magistral Medium 73.6% Mistral AI lança modelo de raciocínio Magistral com versões aberta e empresarial
2025-05-30 Deepseek-R1-0528-Qwen3-8B 86.0% DeepSeek atualiza modelo R1 com raciocínio aprimorado e melhores pontuações em benchmarks
2025-05-30 Deepseek-R1-0528 91.4% DeepSeek atualiza modelo R1 com raciocínio aprimorado e melhores pontuações em benchmarks
2025-05-14 Qwen3-235B-A22B 85.7% Qwen3 introduz modo unificado de raciocínio e suporte a 119 idiomas
2025-04-17 o4-mini 93.4% OpenAI lança o4-mini, um modelo de raciocínio multimodal mais rápido e barato
2025-04-16 OpenAI o3 91.6% OpenAI
2025-04-10 Seed1.5-Thinking 86.7% Seed1.5-Thinking usa aprendizado por reforço para melhorar o raciocínio
2025-03-26 Gemini 2.5 Pro 92.0% Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens
2025-03-24 DeepSeek-V3-0324 59.4% DeepSeek-V3-0324 melhora raciocínio, programação e escrita em chinês em relação ao DeepSeek-V3
2025-03-05 GPT-4.5 36.7% OpenAI lança GPT-4.5, seu maior modelo, para o ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 80.0% Anthropic lança Claude 3.7 Sonnet com controle dinâmico de raciocínio
2025-02-19 Grok 3 mini 95.8% xAI lança Grok 3 Beta e agente DeepSearch
2025-02-05 LIMO 57.1% GAIR-NLP lança LIMO, alcançando forte raciocínio matemático com 817 amostras
2025-01-31 s1-32B 57.0% Laboratório Simple Scaling lança s1-32B com escalonamento no momento do teste via forçamento de orçamento
2025-01-31 s1-32B 57.0% s1-32B supera o1-preview em matemática de competições usando escalonamento simples no tempo de teste
2025-01-22 DeepSeek-R1-Distill-Qwen-7B 55.5% DeepSeek lança modelos de raciocínio R1 por meio de aprendizado por reforço
2025-01-22 DeepSeek-R1-Zero 71.0% DeepSeek lança modelos de raciocínio R1 por meio de aprendizado por reforço
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 72.6% DeepSeek lança modelos de raciocínio R1 por meio de aprendizado por reforço
2025-01-22 DeepSeek-R1 79.8% DeepSeek lança modelos de raciocínio R1 por meio de aprendizado por reforço
2025-01-20 DeepSeek R1 79.8% DeepSeek
2024-12-20 o3 96.7% OpenAI lança modelo o3 com alto desempenho em raciocínio e programação
2024-11-28 QwQ-32B-Preview 50.0% Qwen lança QwQ-32B-Preview, um modelo de raciocínio experimental
2024-10-01 OpenAI o1-preview 83.0% Comparando o1 da OpenAI com outros principais modelos
2024-09-12 o1 13.9% OpenAI lança o1-preview, um modelo de raciocínio que supera especialistas humanos em benchmarks de matemática e ciências