Benchmark · math

GSM8K

saturated 11 resultados 10 modelos

GSM8K (Grade School Math 8K) é um benchmark de problemas matemáticos escolares em forma de enunciado, cada um exigindo vários passos de raciocínio aritmético; o modelo é pontuado pela porcentagem de problemas em que sua resposta numérica final está correta.

Saiba mais
Exemplo
Um problema curto como «Natalia vendeu prendedores para 48 amigas em abril e metade disso em maio; quantos prendedores ela vendeu no total?» — o modelo precisa percorrer os passos e dar o número final.
Pontuação
A pontuação é a accuracy (acurácia): a proporção de problemas cuja resposta numérica final corresponde exatamente à resposta de referência; o raciocínio intermediário não é avaliado, apenas o número final.
Verificação
A verificação é automática e por correspondência exata: o número final do modelo é extraído (geralmente após um delimitador como «####») e comparado com a resposta correta, sem necessidade de julgamento humano.
Por que importa
Tornou-se um teste padrão e fácil de checar de raciocínio em vários passos, e a conhecida técnica de prompting chain-of-thought mostrou melhorar bastante os resultados, o que a transformou em uma régua comum da capacidade de raciocínio.
Exemplo resolvido
Tarefa
Maria tem 3 caixas de giz de cera com 24 gizes em cada caixa. Ela dá 15 gizes ao irmão e depois compra mais 2 caixas cheias. Quantos gizes ela tem agora?
Solução
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
Explicação
Multiplica-se para obter o total inicial, subtrai-se o que ela dá e somam-se as caixas novas: 72 − 15 + 48 = 105. O GSM8K avalia apenas o número final extraído após o delimitador '####' por correspondência exata, então os passos do raciocínio não são pontuados — só 105 conta.
0 25 50 75 100 2023-03-14 2024-11-18 2026-07-26 Grok-1.5 · 90 · 2024-03-28 DUP method · 97.1 · 2024-04-23 Claude 3.5 Sonnet · 91.6 · 2024-06-20 Qwen2-72B · 89.5 · 2024-07-15 Qwen2-72B · 89.5 · 2024-07-15 Falcon3-10B-Base · 83 · 2024-12-17 Falcon3-7B-Base · 79.1 · 2024-12-17 Falcon3-10B-Instruct · 83.1 · 2024-12-17 Gemma-4-12B · 86 · 2026-07-13 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 · 74.2 · 2026-07-26 GPT-4 · 92 · 2023-03-14
Grok-1.5 DUP method Claude 3.5 Sonnet Qwen2-72B Falcon3-10B-Base Falcon3-7B-Base Falcon3-10B-Instruct Gemma-4-12B Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 GPT-4
Linha do tempo
Data Modelo Pontuação Fonte
2026-07-26 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 74.219% CrowdTensor lança Beta de treinamento voluntário e RFC de Campanha Qwen2.5-7B GSM8K em rascunho
2026-07-13 Gemma-4-12B 86.0% Flint comprime rastros de raciocínio para reduzir o uso de tokens enquanto mantém a precisão
2024-12-17 Falcon3-10B-Base 83.0% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código
2024-12-17 Falcon3-7B-Base 79.1% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código
2024-12-17 Falcon3-10B-Instruct 83.1% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código
2024-07-15 Qwen2-72B 89.5% Equipe Qwen lança série Qwen2 com modelos densos e MoE de 72B
2024-07-15 Qwen2-72B 89.5% Relatório Técnico do Qwen2 apresenta modelos densos e MoE até 72B
2024-06-20 Claude 3.5 Sonnet 91.6% Anthropic lança adendo do Claude 3.5 Sonnet com benchmarks de codificação e visão aprimorados
2024-04-23 DUP method 97.1% Compreensão profunda dos problemas: método atinge 97,1% no GSM8K
2024-03-28 Grok-1.5 90.0% xAI lança Grok-1.5 com raciocínio aprimorado e contexto de 128K
2023-03-14 GPT-4 92.0% OpenAI