Benchmark · math

AIME 2024

30 resultados 27 modelos

AIME 2024 mide el razonamiento matemático avanzado de un modelo con los 15 problemas del American Invitational Mathematics Examination de 2024 e informa el porcentaje resuelto correctamente.

Leer más
Ejemplo
Un ítem típico es un problema difícil de olimpiada escolar —por ejemplo, de teoría de números o combinatoria— cuya respuesta es un único número entero (en AIME la respuesta siempre es un entero, habitualmente de 0 a 999).
Puntuación
La métrica es la exactitud: la proporción de los 15 problemas respondidos correctamente, de modo que cada problema resuelto vale 1/15 de la puntuación.
Verificación
El resultado se acepta por coincidencia exacta: el número entero final del modelo debe igualar la respuesta oficial, verificado de forma automática, sin puntuación parcial ni juicio humano.
Por qué importa
Al ser un conjunto compacto de problemas de competición difíciles y recientes que exigen razonamiento de varios pasos, se usa mucho para comparar modelos de frontera, y su novedad reduce la contaminación de los datos de entrenamiento.
Ejemplo resuelto
Tarea
¿Cuántos enteros positivos n ≤ 600 son divisibles por 4 o por 6 pero no por 5? (Las respuestas de AIME son enteros de 0 a 999.)
Solución
Multiples of 4 or 6 that are ≤ 600: 150 + 100 − 50 = 200. Of these, the ones also divisible by 5 (multiples of 20 or 30, minus 60): 30 + 20 − 10 = 40. Answer: 200 − 40 = 160.
Explicación
Por inclusión-exclusión, 200 enteros son divisibles por 4 o 6, y 40 de ellos también por 5, quedando 160. AIME califica automáticamente solo el entero final (0–999), sin crédito parcial por el desarrollo.
0 25 50 75 100 2024-09-12 2025-08-09 2026-07-07 o1 · 13.9 · 2024-09-12 OpenAI o1-preview · 83 · 2024-10-01 QwQ-32B-Preview · 50 · 2024-11-28 o3 · 96.7 · 2024-12-20 o3 · 96.7 · 2026-03-25 DeepSeek-R1-Distill-Qwen-7B · 55.5 · 2025-01-22 DeepSeek-R1-Zero · 71 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 72.6 · 2025-01-22 DeepSeek-R1 · 79.8 · 2025-01-22 s1-32B · 57 · 2025-01-31 s1-32B · 57 · 2025-01-31 LIMO · 57.1 · 2025-02-05 Grok 3 mini · 95.8 · 2025-02-19 Claude 3.7 Sonnet · 80 · 2025-02-24 GPT-4.5 · 36.7 · 2025-03-05 DeepSeek-V3-0324 · 59.4 · 2025-03-24 Gemini 2.5 Pro · 92 · 2025-03-26 Seed1.5-Thinking · 86.7 · 2025-04-10 o4-mini · 93.4 · 2025-04-17 Qwen3-235B-A22B · 85.7 · 2025-05-14 Deepseek-R1-0528-Qwen3-8B · 86 · 2025-05-30 Deepseek-R1-0528 · 91.4 · 2025-05-30 Magistral Small · 70.7 · 2025-06-10 Magistral Medium · 73.6 · 2025-06-10 Magistral Medium · 50 · 2025-06-12 GLM-4.5 · 91 · 2025-08-06 GLM-4.5-Air · 89.4 · 2025-08-06 Qwen3-1.7B · 62.4 · 2026-07-07 DeepSeek R1 · 79.8 · 2025-01-20 OpenAI o3 · 91.6 · 2025-04-16
o1 OpenAI o1-preview QwQ-32B-Preview o3 DeepSeek-R1-Distill-Qwen-7B DeepSeek-R1-Zero DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 s1-32B LIMO Grok 3 mini Claude 3.7 Sonnet GPT-4.5 DeepSeek-V3-0324 Gemini 2.5 Pro Seed1.5-Thinking o4-mini Qwen3-235B-A22B Deepseek-R1-0528-Qwen3-8B Deepseek-R1-0528 Magistral Small Magistral Medium GLM-4.5 GLM-4.5-Air Qwen3-1.7B DeepSeek R1 OpenAI o3
Cronología
Fecha Modelo Puntuación Fuente
2026-07-07 Qwen3-1.7B 62.4% Direct-OPD destila ganancias de RL débil-a-fuerte para modelos más potentes
2026-03-25 o3 96.7% OpenAI anuncia la retirada de o3 de ChatGPT y comparte puntuaciones de benchmarks
2025-08-06 GLM-4.5 91.0% Zhipu AI lanza los modelos GLM-4.5 que igualan a Claude y DeepSeek
2025-08-06 GLM-4.5-Air 89.4% Zhipu AI lanza los modelos GLM-4.5 que igualan a Claude y DeepSeek
2025-06-12 Magistral Medium 50.0% Mistral presenta modelos de razonamiento Magistral con una canalización de RL escalable
2025-06-10 Magistral Small 70.7% Mistral AI lanza el modelo de razonamiento Magistral con versiones abiertas y empresariales
2025-06-10 Magistral Medium 73.6% Mistral AI lanza el modelo de razonamiento Magistral con versiones abiertas y empresariales
2025-05-30 Deepseek-R1-0528-Qwen3-8B 86.0% DeepSeek actualiza el modelo R1 con mejor razonamiento y puntuaciones en benchmarks
2025-05-30 Deepseek-R1-0528 91.4% DeepSeek actualiza el modelo R1 con mejor razonamiento y puntuaciones en benchmarks
2025-05-14 Qwen3-235B-A22B 85.7% Qwen3 introduce un modo de pensamiento unificado y soporte para 119 idiomas
2025-04-17 o4-mini 93.4% OpenAI lanza o4-mini, un modelo de razonamiento multimodal más rápido y económico
2025-04-16 OpenAI o3 91.6% OpenAI
2025-04-10 Seed1.5-Thinking 86.7% Seed1.5-Thinking utiliza aprendizaje por refuerzo para mejorar el razonamiento
2025-03-26 Gemini 2.5 Pro 92.0% Google lanza el modelo de razonamiento experimental Gemini 2.5 Pro con contexto de 1M tokens
2025-03-24 DeepSeek-V3-0324 59.4% DeepSeek-V3-0324 mejora el razonamiento, la programación y la escritura en chino respecto a DeepSeek-V3
2025-03-05 GPT-4.5 36.7% OpenAI lanza GPT-4.5, su modelo más grande, para ChatGPT Plus
2025-02-24 Claude 3.7 Sonnet 80.0% Anthropic lanza Claude 3.7 Sonnet con control dinámico de razonamiento
2025-02-19 Grok 3 mini 95.8% xAI lanza Grok 3 Beta y el agente DeepSearch
2025-02-05 LIMO 57.1% GAIR-NLP lanza LIMO, logrando un fuerte razonamiento matemático con 817 muestras
2025-01-31 s1-32B 57.0% Simple Scaling Lab lanza s1-32B con escalado en tiempo de prueba mediante forzamiento de presupuesto
2025-01-31 s1-32B 57.0% s1-32B supera a o1-preview en matemáticas competitivas mediante escalado simple en el momento de la prueba
2025-01-22 DeepSeek-R1-Distill-Qwen-7B 55.5% DeepSeek lanza modelos de razonamiento R1 mediante aprendizaje por refuerzo
2025-01-22 DeepSeek-R1-Zero 71.0% DeepSeek lanza modelos de razonamiento R1 mediante aprendizaje por refuerzo
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 72.6% DeepSeek lanza modelos de razonamiento R1 mediante aprendizaje por refuerzo
2025-01-22 DeepSeek-R1 79.8% DeepSeek lanza modelos de razonamiento R1 mediante aprendizaje por refuerzo
2025-01-20 DeepSeek R1 79.8% DeepSeek
2024-12-20 o3 96.7% OpenAI lanza el modelo o3 con alto rendimiento en razonamiento y programación
2024-11-28 QwQ-32B-Preview 50.0% Qwen lanza QwQ-32B-Preview, un modelo de razonamiento experimental
2024-10-01 OpenAI o1-preview 83.0% Comparando OpenAI o1 con otros modelos principales
2024-09-12 o1 13.9% OpenAI lanza o1-preview, un modelo de razonamiento que supera a expertos humanos en pruebas de matemáticas y ciencias