Benchmark · math

MATH-500

saturated 18 resultados 17 modelos

MATH-500 es un subconjunto de 500 problemas del conjunto de datos de matemáticas de competición MATH, que evalúa la capacidad de un modelo para resolver problemas matemáticos difíciles. La puntuación es el porcentaje de problemas cuya respuesta final acierta el modelo.

Leer más
Ejemplo
Un elemento típico es un problema matemático de tipo competición; por ejemplo, una pregunta de álgebra, geometría o teoría de números que pide una única respuesta final (un número o una expresión en forma cerrada) tras varios pasos de razonamiento.
Puntuación
La puntuación es la proporción de los 500 problemas que el modelo responde correctamente, es decir, accuracy = respuestas finales correctas / 500, expresada como porcentaje.
Verificación
Un problema se cuenta como resuelto cuando la respuesta final del modelo coincide exactamente con la respuesta de referencia (una comprobación automática de equivalencia de la respuesta final, no de los pasos intermedios).
Por qué importa
Es una medida compacta y muy usada del razonamiento matemático que se ejecuta más rápido que el conjunto MATH completo, por lo que es una comprobación rápida habitual al comparar modelos de razonamiento.
Ejemplo resuelto
Tarea
Para ciertos valores de $k$, la ecuación cuadrática $x^2 - kx + 16 = 0$ tiene solo raíces enteras positivas. Halla la suma de todos los valores distintos posibles de $k$.
Solución
Roots $r,s$: $rs=16$, $k=r+s$. Pairs $(1,16),(2,8),(4,4)\Rightarrow k\in\{17,10,8\}$. Distinct sum $=17+10+8=\boxed{35}$.
Explicación
Las raíces $r,s$ son enteros positivos con $rs=16$ y $k=r+s$; los pares de factores $(1,16),(2,8),(4,4)$ dan $k=17,10,8$, así que la suma de los valores distintos es $35$. MATH-500 califica por coincidencia exacta de la respuesta final normalizada en \boxed{}, por lo que solo cuenta $35$.
0 25 50 75 100 2024-02-05 2025-04-21 2026-07-07 DeepSeekMath 7B · 51.7 · 2024-02-05 Grok-1.5 · 50.6 · 2024-03-28 Claude 3.5 Sonnet · 71.1 · 2024-06-20 Claude 3.5 Sonnet · 82.2 · 2025-02-26 QwQ-32B-Preview · 90.6 · 2024-11-28 Kimi k1.5 · 96.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 94.6 · 2025-01-22 DeepSeek-R1 · 97.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 94.3 · 2025-01-22 LIMO · 94.8 · 2025-02-05 Claude 3.7 Sonnet · 96.2 · 2025-02-26 Gemini 2.0 Flash · 90.9 · 2025-04-15 Phi-4-Mini-Reasoning · 3.2 · 2025-04-30 Llama-8B · 89.1 · 2025-04-30 Qwen-1.5B · 83.9 · 2025-04-30 GLM-4.5 · 98.2 · 2025-08-06 Qwen3.6-27B · 87 · 2026-07-07 Qwen3.6-27B-DFlash · 86 · 2026-07-07
DeepSeekMath 7B Grok-1.5 Claude 3.5 Sonnet QwQ-32B-Preview Kimi k1.5 Kimi k1.5 (short-CoT) DeepSeek-R1 DeepSeek-R1-Distill-Qwen-32B LIMO Claude 3.7 Sonnet Gemini 2.0 Flash Phi-4-Mini-Reasoning Llama-8B Qwen-1.5B GLM-4.5 Qwen3.6-27B Qwen3.6-27B-DFlash
Cronología
Fecha Modelo Puntuación Fuente
2026-07-07 Qwen3.6-27B 87.0% La fusión de DFlash en llama.cpp produce una aceleración de 4.44x en Qwen 3.6 27B
2026-07-07 Qwen3.6-27B-DFlash 86.0% La fusión de DFlash en llama.cpp produce una aceleración de 4.44x en Qwen 3.6 27B
2025-08-06 GLM-4.5 98.2% Zhipu AI lanza los modelos GLM-4.5 que igualan a Claude y DeepSeek
2025-04-30 Phi-4-Mini-Reasoning 3.2% Microsoft lanza Phi-4-Mini-Reasoning, un modelo de 3.8B que supera a modelos de razonamiento más grandes
2025-04-30 Llama-8B 89.1% Microsoft lanza Phi-4-Mini-Reasoning, un modelo de 3.8B que supera a modelos de razonamiento más grandes
2025-04-30 Qwen-1.5B 83.9% Microsoft lanza Phi-4-Mini-Reasoning, un modelo de 3.8B que supera a modelos de razonamiento más grandes
2025-04-15 Gemini 2.0 Flash 90.9% Google lanza Gemini 2.0 Flash con calidad mejorada y el doble de velocidad que Gemini 1.5 Pro
2025-02-26 Claude 3.7 Sonnet 96.2% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 82.2% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-05 LIMO 94.8% GAIR-NLP lanza LIMO, logrando un fuerte razonamiento matemático con 817 muestras
2025-01-22 Kimi k1.5 96.2% Kimi k1.5 escala el aprendizaje por refuerzo con LLMs para igualar a o1 y superar a los modelos de CoT corto
2025-01-22 Kimi k1.5 (short-CoT) 94.6% Kimi k1.5 escala el aprendizaje por refuerzo con LLMs para igualar a o1 y superar a los modelos de CoT corto
2025-01-22 DeepSeek-R1 97.3% DeepSeek lanza modelos de razonamiento R1 mediante aprendizaje por refuerzo
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 94.3% DeepSeek lanza modelos de razonamiento R1 mediante aprendizaje por refuerzo
2024-11-28 QwQ-32B-Preview 90.6% Qwen lanza QwQ-32B-Preview, un modelo de razonamiento experimental
2024-06-20 Claude 3.5 Sonnet 71.1% Anthropic lanza un apéndice de Claude 3.5 Sonnet con mejores benchmarks de codificación y visión
2024-03-28 Grok-1.5 50.6% xAI lanza Grok-1.5 con razonamiento mejorado y contexto de 128K
2024-02-05 DeepSeekMath 7B 51.7% DeepSeekMath 7B alcanza 51,7% en el benchmark MATH usando GRPO y datos curados