Benchmark · math

AIME 2025

31 resultados 27 modelos

AIME 2025 evalúa el razonamiento matemático avanzado de un modelo con los 15 problemas del American Invitational Mathematics Examination de 2025, una difícil competición de secundaria. Cada respuesta es un número entero de 0 a 999, y la puntuación del modelo es el porcentaje de problemas resueltos correctamente (a menudo reportado como pass@1 o avg@k).

Leer más
Ejemplo
Un ítem típico es un problema de competición exigente —por ejemplo, de teoría de números o combinatoria— cuya solución es un único entero entre 0 y 999, como hallar el número de pares ordenados que cumplen un conjunto dado de condiciones algebraicas.
Puntuación
Cada uno de los 15 problemas se califica por coincidencia exacta de su respuesta entera, y la puntuación es la fracción (porcentaje) resuelta correctamente; como las respuestas varían entre ejecuciones, los resultados suelen promediarse sobre muchas muestras (avg@k) o reportarse como pass@1.
Verificación
La verificación es automática y objetiva: el entero final del modelo se compara con la clave de respuestas oficial, sin crédito parcial ni juicio humano, de modo que una solución solo se acepta con una coincidencia numérica exacta.
Por qué importa
Los problemas de AIME exigen razonamiento creativo de varios pasos en lugar de memorización, por lo que este benchmark es una medida muy seguida de la capacidad matemática de los LLM de frontera y una cifra destacada habitual cuando se lanzan nuevos modelos de razonamiento.
Ejemplo resuelto
Tarea
Problema representativo al estilo AIME (la respuesta es un entero de 0 a 999): halla la suma de todos los enteros positivos n para los que √(n² + 85n + 2017) es un entero.
Solución
Completa el cuadrado: (2m)² − (2n+85)² = 843 = 3·281. Factoriza la diferencia de cuadrados: (2m−2n−85)(2m+2n+85) = 843, lo que da n = 168 o n = 27. Suma = 168 + 27 = 195.
Explicación
Completar el cuadrado convierte la condición en una diferencia de cuadrados (2m)² − (2n+85)² = 843 = 3·281, cuyas únicas factorizaciones positivas dan n = 168 y n = 27, sumando 195. AIME se califica por coincidencia exacta de la única respuesta entera (0–999), sin crédito parcial.
0 25 50 75 100 2025-01-22 2025-10-17 2026-07-13 Kimi k1.5 (short-CoT) · 60.8 · 2025-01-22 Kimi k1.5 · 77.5 · 2025-01-22 Grok 3 (Think) · 93.3 · 2025-02-19 Grok 3 Beta · 93.3 · 2025-02-26 OpenAI o3-mini · 83.3 · 2025-02-26 DeepSeek R1 · 79.8 · 2025-02-26 Claude 3.7 Sonnet · 61.3 · 2025-02-26 Claude 3.5 Sonnet · 41.3 · 2025-02-26 Grok 3 · 93.3 · 2025-03-11 Gemini 2.5 Pro (experimental) · 86.7 · 2025-03-25 Gemini 2.5 Pro · 86.7 · 2025-03-26 OpenAI o3 · 98.4 · 2025-04-16 OpenAI o4-mini · 99.5 · 2025-04-16 o4-mini · 92.7 · 2025-04-17 Qwen3-235B-A22B · 81.5 · 2025-05-14 DeepSeek-R1-0528 · 87.5 · 2025-05-28 Deepseek-R1-0528 · 87.5 · 2025-05-30 Grok 4 · 88 · 2025-07-25 Kimi K2 · 49.5 · 2025-07-28 Kimi K2 · 49.5 · 2025-07-28 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GLM-4.6 · 93.9 · 2025-09-30 Claude Sonnet 4.5 · 100 · 2025-09-30 Kimi K2.5 · 96.1 · 2026-01-27 o1-pro · 86 · 2026-05-14 Agents-A1 · 79 · 2026-06-30 DASH · 50.8 · 2026-07-05 Mach-Mind-4-Flash · 92.7 · 2026-07-13 Mach-Mind-4-Flash · 92.7 · 2026-07-13
Kimi k1.5 (short-CoT) Kimi k1.5 Grok 3 (Think) Grok 3 Beta OpenAI o3-mini DeepSeek R1 Claude 3.7 Sonnet Claude 3.5 Sonnet Grok 3 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro OpenAI o3 OpenAI o4-mini o4-mini Qwen3-235B-A22B DeepSeek-R1-0528 Deepseek-R1-0528 Grok 4 Kimi K2 GPT-5 GLM-4.6 Claude Sonnet 4.5 Kimi K2.5 o1-pro Agents-A1 DASH Mach-Mind-4-Flash
Cronología
Fecha Modelo Puntuación Fuente
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: El modelo agénico MoE de 35B iguala a modelos más grandes mediante optimización post-entrenamiento
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: modelo agénico MoE de 35B iguala a modelos más grandes mediante optimización post-entrenamiento
2026-07-05 DASH 50.8% DASH reduce el sobre-pensamiento en modelos de lenguaje de razonamiento mediante asignación de crédito a nivel de segmento
2026-06-30 Agents-A1 79.0pts Escalar el horizonte, no los parámetros: alcanzar rendimiento de billones de parámetros con un agente de 35B
2026-05-14 o1-pro 86.0% OpenAI lanza la familia o1 estableciendo la era del razonamiento con cómputo en tiempo de inferencia
2026-01-27 Kimi K2.5 96.1% Moonshot lanza Kimi K2.5 con tecnología Agent Swarm
2025-09-30 GLM-4.6 93.9% Zhipu AI lanza GLM-4.6 con capacidades agénticas y ventana de contexto de 128k
2025-09-30 Claude Sonnet 4.5 100.0% Anthropic lanza Claude Sonnet 4.5 con capacidades mejoradas de codificación y agentes
2025-08-07 GPT-5 94.6% OpenAI lanza GPT-5 con razonamiento adaptativo y arquitectura unificada
2025-08-07 GPT-5 94.6% OpenAI presenta GPT-5 con enrutamiento unificado y razonamiento de nivel experto
2025-08-07 GPT-5 94.6% OpenAI
2025-07-28 Kimi K2 49.5% Kimi K2: modelo MoE abierto con 1T parámetros y optimizador MuonClip
2025-07-28 Kimi K2 49.5% Moonshot lanza Kimi K2, un modelo MoE agénico abierto con 32B de parámetros activados
2025-07-25 Grok 4 88.0% Epoch AI evalúa las capacidades matemáticas de Grok 4
2025-05-30 Deepseek-R1-0528 87.5% DeepSeek actualiza el modelo R1 con mejor razonamiento y puntuaciones en benchmarks
2025-05-28 DeepSeek-R1-0528 87.5% DeepSeek-R1-0528 mejora el razonamiento y la precisión en AIME hasta 87,5%
2025-05-14 Qwen3-235B-A22B 81.5% Qwen3 introduce un modo de pensamiento unificado y soporte para 119 idiomas
2025-04-17 o4-mini 92.7% OpenAI lanza o4-mini, un modelo de razonamiento multimodal más rápido y económico
2025-04-16 OpenAI o3 98.4% OpenAI lanza los modelos de razonamiento o3 y o4-mini con uso de herramientas agénticas
2025-04-16 OpenAI o4-mini 99.5% OpenAI lanza los modelos de razonamiento o3 y o4-mini con uso de herramientas agénticas
2025-03-26 Gemini 2.5 Pro 86.7% Google lanza el modelo de razonamiento experimental Gemini 2.5 Pro con contexto de 1M tokens
2025-03-25 Gemini 2.5 Pro (experimental) 86.7% Google DeepMind lanza el modelo experimental Gemini 2.5 Pro
2025-03-11 Grok 3 93.3% xAI lanza Grok 3 con razonamiento profundo y contexto de un millón de tokens
2025-02-26 Grok 3 Beta 93.3% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-26 OpenAI o3-mini 83.3% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-26 DeepSeek R1 79.8% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-26 Claude 3.7 Sonnet 61.3% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-26 Claude 3.5 Sonnet 41.3% Comparativa de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 y Grok 3 Beta
2025-02-19 Grok 3 (Think) 93.3% xAI lanza Grok 3 Beta y el agente DeepSearch
2025-01-22 Kimi k1.5 (short-CoT) 60.8% Kimi k1.5 escala el aprendizaje por refuerzo con LLMs para igualar a o1 y superar a los modelos de CoT corto
2025-01-22 Kimi k1.5 77.5% Kimi k1.5 escala el aprendizaje por refuerzo con LLMs para igualar a o1 y superar a los modelos de CoT corto