Benchmark · math

MATH-500

saturated 18 resultados 17 modelos

O MATH-500 é um subconjunto de 500 problemas do conjunto de dados de matemática de competição MATH, usado para avaliar a capacidade de um modelo de resolver problemas matemáticos difíceis. A pontuação é a porcentagem de problemas cuja resposta final o modelo acerta.

Saiba mais
Exemplo
Um item típico é um problema matemático no estilo de competição — por exemplo, uma questão de álgebra, geometria ou teoria dos números que pede uma única resposta final (um número ou uma expressão em forma fechada) após várias etapas de raciocínio.
Pontuação
A pontuação é a proporção dos 500 problemas que o modelo responde corretamente, ou seja, accuracy = respostas finais corretas / 500, expressa como porcentagem.
Verificação
Um problema é considerado resolvido quando a resposta final do modelo coincide exatamente com a resposta de referência (uma verificação automática de equivalência da resposta final, e não das etapas intermediárias).
Por que importa
É uma medida compacta e amplamente usada de raciocínio matemático que roda mais rápido que o conjunto MATH completo, por isso é uma verificação rápida comum ao comparar modelos de raciocínio.
Exemplo resolvido
Tarefa
Para certos valores de $k$, a equação quadrática $x^2 - kx + 16 = 0$ tem apenas raízes inteiras positivas. Encontre a soma de todos os valores distintos possíveis de $k$.
Solução
Roots $r,s$: $rs=16$, $k=r+s$. Pairs $(1,16),(2,8),(4,4)\Rightarrow k\in\{17,10,8\}$. Distinct sum $=17+10+8=\boxed{35}$.
Explicação
As raízes $r,s$ são inteiros positivos com $rs=16$ e $k=r+s$; os pares de fatores $(1,16),(2,8),(4,4)$ dão $k=17,10,8$, então a soma dos valores distintos é $35$. O MATH-500 avalia por correspondência exata da resposta final normalizada em \boxed{}, portanto apenas $35$ conta.
0 25 50 75 100 2024-02-05 2025-04-21 2026-07-07 DeepSeekMath 7B · 51.7 · 2024-02-05 Grok-1.5 · 50.6 · 2024-03-28 Claude 3.5 Sonnet · 71.1 · 2024-06-20 Claude 3.5 Sonnet · 82.2 · 2025-02-26 QwQ-32B-Preview · 90.6 · 2024-11-28 Kimi k1.5 · 96.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 94.6 · 2025-01-22 DeepSeek-R1 · 97.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 94.3 · 2025-01-22 LIMO · 94.8 · 2025-02-05 Claude 3.7 Sonnet · 96.2 · 2025-02-26 Gemini 2.0 Flash · 90.9 · 2025-04-15 Phi-4-Mini-Reasoning · 3.2 · 2025-04-30 Llama-8B · 89.1 · 2025-04-30 Qwen-1.5B · 83.9 · 2025-04-30 GLM-4.5 · 98.2 · 2025-08-06 Qwen3.6-27B · 87 · 2026-07-07 Qwen3.6-27B-DFlash · 86 · 2026-07-07
DeepSeekMath 7B Grok-1.5 Claude 3.5 Sonnet QwQ-32B-Preview Kimi k1.5 Kimi k1.5 (short-CoT) DeepSeek-R1 DeepSeek-R1-Distill-Qwen-32B LIMO Claude 3.7 Sonnet Gemini 2.0 Flash Phi-4-Mini-Reasoning Llama-8B Qwen-1.5B GLM-4.5 Qwen3.6-27B Qwen3.6-27B-DFlash
Linha do tempo
Data Modelo Pontuação Fonte
2026-07-07 Qwen3.6-27B 87.0% Fusão do DFlash no llama.cpp gera aceleração de 4.44x no Qwen 3.6 27B
2026-07-07 Qwen3.6-27B-DFlash 86.0% Fusão do DFlash no llama.cpp gera aceleração de 4.44x no Qwen 3.6 27B
2025-08-06 GLM-4.5 98.2% Zhipu AI lança modelos GLM-4.5 que igualam Claude e DeepSeek
2025-04-30 Phi-4-Mini-Reasoning 3.2% Microsoft lança Phi-4-Mini-Reasoning, um modelo de 3.8B que supera modelos de raciocínio maiores
2025-04-30 Llama-8B 89.1% Microsoft lança Phi-4-Mini-Reasoning, um modelo de 3.8B que supera modelos de raciocínio maiores
2025-04-30 Qwen-1.5B 83.9% Microsoft lança Phi-4-Mini-Reasoning, um modelo de 3.8B que supera modelos de raciocínio maiores
2025-04-15 Gemini 2.0 Flash 90.9% Google lança Gemini 2.0 Flash com qualidade aprimorada e o dobro da velocidade do Gemini 1.5 Pro
2025-02-26 Claude 3.7 Sonnet 96.2% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 82.2% Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
2025-02-05 LIMO 94.8% GAIR-NLP lança LIMO, alcançando forte raciocínio matemático com 817 amostras
2025-01-22 Kimi k1.5 96.2% Kimi k1.5 escala aprendizado por reforço com LLMs para igualar o1 e superar modelos de CoT curto
2025-01-22 Kimi k1.5 (short-CoT) 94.6% Kimi k1.5 escala aprendizado por reforço com LLMs para igualar o1 e superar modelos de CoT curto
2025-01-22 DeepSeek-R1 97.3% DeepSeek lança modelos de raciocínio R1 por meio de aprendizado por reforço
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 94.3% DeepSeek lança modelos de raciocínio R1 por meio de aprendizado por reforço
2024-11-28 QwQ-32B-Preview 90.6% Qwen lança QwQ-32B-Preview, um modelo de raciocínio experimental
2024-06-20 Claude 3.5 Sonnet 71.1% Anthropic lança adendo do Claude 3.5 Sonnet com benchmarks de codificação e visão aprimorados
2024-03-28 Grok-1.5 50.6% xAI lança Grok-1.5 com raciocínio aprimorado e contexto de 128K
2024-02-05 DeepSeekMath 7B 51.7% DeepSeekMath 7B alcança 51,7% no benchmark MATH usando GRPO e dados curados