Benchmark · math

GSM8K

saturated 13 resultados 11 modelos

GSM8K (Grade School Math 8K) es un benchmark de problemas matemáticos de primaria planteados como enunciados, cada uno con varios pasos de razonamiento aritmético; el modelo se puntúa por el porcentaje de problemas en los que su respuesta numérica final es correcta.

Leer más
Ejemplo
Un problema breve como «Natalia vendió clips a 48 amigas en abril y la mitad en mayo; ¿cuántos clips vendió en total?»: el modelo debe recorrer los pasos y dar el número final.
Puntuación
La puntuación es la accuracy (exactitud): la proporción de problemas cuya respuesta numérica final coincide exactamente con la respuesta de referencia; el razonamiento intermedio no se califica, solo el número final.
Verificación
La verificación es automática y por coincidencia exacta: se extrae el número final del modelo (normalmente tras un delimitador como «####») y se compara con la respuesta correcta, sin necesidad de juicio humano.
Por qué importa
Se convirtió en una prueba estándar y fácil de comprobar del razonamiento de varios pasos, y se demostró que la conocida técnica de prompting chain-of-thought mejora mucho los resultados, lo que la hizo una vara de medir habitual de la capacidad de razonar.
Ejemplo resuelto
Tarea
María tiene 3 cajas de crayones con 24 crayones en cada caja. Le da 15 crayones a su hermano y luego compra 2 cajas llenas más. ¿Cuántos crayones tiene ahora?
Solución
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
Explicación
Se multiplica para obtener el total inicial, se resta lo que regala y se suman las cajas nuevas: 72 − 15 + 48 = 105. GSM8K califica solo el número final extraído tras el delimitador '####' por coincidencia exacta, así que los pasos del razonamiento no puntúan — solo cuenta 105.
0 25 50 75 100 2023-03-14 2024-11-18 2026-07-26 Grok-1.5 · 90 · 2024-03-28 DUP method · 97.1 · 2024-04-23 Claude 3.5 Sonnet · 91.6 · 2024-06-20 Qwen2-72B · 89.5 · 2024-07-15 Qwen2-72B · 89.5 · 2024-07-15 Falcon3-10B-Instruct · 83.1 · 2024-12-17 Falcon3-10B-Base · 83 · 2024-12-17 Falcon3-7B-Base · 79.1 · 2024-12-17 LLaDA-8B · 76 · 2026-06-28 LLaDA-8B · 76 · 2026-06-29 Gemma-4-12B · 86 · 2026-07-13 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 · 74.2 · 2026-07-26 GPT-4 · 92 · 2023-03-14
Grok-1.5 DUP method Claude 3.5 Sonnet Qwen2-72B Falcon3-10B-Instruct Falcon3-10B-Base Falcon3-7B-Base LLaDA-8B Gemma-4-12B Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 GPT-4
Cronología
Fecha Modelo Puntuación Fuente
2026-07-26 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 74.219% CrowdTensor lanza la Beta de entrenamiento voluntario y el borrador de la RFC de la campaña Qwen2.5-7B GSM8K
2026-07-13 Gemma-4-12B 86.0% Flint comprime las trazas de razonamiento para reducir el uso de tokens mientras mantiene la precisión
2026-06-29 LLaDA-8B 76.0% Reflexiones sobre la programación: Aprender el orden del pensamiento en modelos de lenguaje de difusión
2026-06-28 LLaDA-8B 76.0% El Enrutamiento Consciente de Sí Mismo Aprende el Orden de Desenmascaramiento de Tokens en Modelos de Lenguaje de Difusión
2024-12-17 Falcon3-10B-Instruct 83.1% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código
2024-12-17 Falcon3-10B-Base 83.0% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código
2024-12-17 Falcon3-7B-Base 79.1% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código
2024-07-15 Qwen2-72B 89.5% El equipo de Qwen lanza la serie Qwen2 con modelos densos y MoE de 72B
2024-07-15 Qwen2-72B 89.5% El informe técnico de Qwen2 presenta modelos densos y MoE de hasta 72B
2024-06-20 Claude 3.5 Sonnet 91.6% Anthropic lanza un apéndice de Claude 3.5 Sonnet con mejores benchmarks de codificación y visión
2024-04-23 DUP method 97.1% Comprensión profunda de los problemas: el método alcanza 97,1% en GSM8K
2024-03-28 Grok-1.5 90.0% xAI lanza Grok-1.5 con razonamiento mejorado y contexto de 128K
2023-03-14 GPT-4 92.0% OpenAI