Benchmark · math

FrontierMath

20 resultados 15 modelos

FrontierMath es un benchmark de Epoch AI que mide qué tan bien un modelo de IA resuelve problemas matemáticos extremadamente difíciles y originales, de nivel de investigación. La puntuación es el porcentaje de problemas que el modelo responde correctamente, y los modelos actuales resuelven solo una pequeña fracción, lejos de la saturación.

Leer más
Ejemplo
Un único problema inédito de un campo avanzado como la teoría de números, la geometría algebraica o la combinatoria, cuya solución exige un conocimiento profundo y se reduce a una única respuesta final definida (por ejemplo, un número entero concreto o un objeto matemático exacto).
Puntuación
La métrica es la exactitud (accuracy): la fracción de problemas cuya respuesta final coincide exactamente con la respuesta de referencia, expresada como porcentaje.
Verificación
Cada problema tiene una única respuesta definida y verificable de forma automática, por lo que una solución solo se acepta si coincide exactamente con la de referencia; los problemas los diseñan matemáticos expertos para que sea casi imposible acertar por azar.
Por qué importa
Como los problemas son nuevos, resiste la memorización, y sigue lejos de resolverse, por lo que es uno de los pocos benchmarks de matemáticas que aún distingue con claridad el razonamiento matemático avanzado real del simple reconocimiento de patrones.
Ejemplo resuelto
Tarea
Determina el número de enteros $n$ con $0 \le n < 3^{13}$ para los cuales el coeficiente binomial central $\binom{2n}{n}$ no es divisible por $3$.
Solución
Por el teorema de Kummer, $3 \nmid \binom{2n}{n}$ exactamente cuando al sumar $n+n$ en base 3 no hay acarreos, es decir, cada dígito de $n$ en base 3 es 0 o 1. En $0 \le n < 3^{13}$ esto da 2 opciones para cada uno de los 13 dígitos, así que el conteo es $2^{13} = 8192$.
Explicación
El teorema de Kummer da $v_3\binom{2n}{n}$ como el número de acarreos al sumar $n$ consigo mismo en base 3; cero acarreos obliga a que cada dígito en base 3 sea 0 o 1, es decir, 2 opciones por dígito en 13 dígitos. Calificación: un verificador automático compara exactamente el único entero final (8192).
0 14 28 42 56 2024-11-08 2025-08-01 2026-04-25 Claude 3.5 Sonnet · 2 · 2024-11-08 Gemini 1.5 Pro · 2 · 2024-11-08 GPT-4o · 2 · 2024-11-08 o1-preview · 2 · 2024-11-08 o3 · 25 · 2024-12-20 o3 · 25 · 2024-12-22 o3 · 25.2 · 2025-01-19 o3 · 25 · 2025-01-29 o3 · 10 · 2025-04-20 o3-mini with high reasoning and a Python tool · 32 · 2025-03-17 Gemini 2.5 Deep Think · 29 · 2025-10-09 GPT-5 Pro · 13 · 2025-10-13 Claude 4.5 Opus · 21 · 2025-12-04 Gemini 3 Pro · 38 · 2025-12-04 GPT-5.2 Thinking · 40.3 · 2025-12-11 GPT-5.2 Pro · 31 · 2026-01-23 GPT-5.5 Pro · 39.6 · 2026-04-23 GPT-5.5 · 35.4 · 2026-04-23 GPT-5.5 · 51.7 · 2026-04-25 OpenAI o3 · 25.2 · 2024-12-20
Claude 3.5 Sonnet Gemini 1.5 Pro GPT-4o o1-preview o3 o3-mini with high reasoning and a Python tool Gemini 2.5 Deep Think GPT-5 Pro Claude 4.5 Opus Gemini 3 Pro GPT-5.2 Thinking GPT-5.2 Pro GPT-5.5 Pro GPT-5.5 OpenAI o3
Cronología
Fecha Modelo Puntuación Fuente
2026-04-25 GPT-5.5 51.7% OpenAI lanza GPT-5.5, un modelo reentrenado desde cero con procesamiento omnimodal nativo
2026-04-23 GPT-5.5 Pro 39.6% OpenAI lanza GPT-5.5 con capacidades agénticas y duplica los precios de la API
2026-04-23 GPT-5.5 35.4% OpenAI lanza GPT-5.5 con capacidades agénticas y duplica los precios de la API
2026-01-23 GPT-5.2 Pro 31.0% GPT-5.2 Pro obtiene un 31% en FrontierMath Tier 4
2025-12-11 GPT-5.2 Thinking 40.3% OpenAI lanza los modelos GPT-5.2 Pro y Thinking para ciencia y matemáticas
2025-12-04 Claude 4.5 Opus 21.0% Epoch AI lanza el Hub de Centros de Datos Fronterizos y analiza la benchmark OSWorld
2025-12-04 Gemini 3 Pro 38.0% Epoch AI lanza el Hub de Centros de Datos Fronterizos y analiza la benchmark OSWorld
2025-10-13 GPT-5 Pro 13.0% GPT-5 Pro resuelve un problema de nivel Tier 4 de FrontierMath, superando a Gemini 2.5 Deep Think
2025-10-09 Gemini 2.5 Deep Think 29.0% Epoch AI evalúa las capacidades matemáticas de Gemini 2.5 Deep Think
2025-04-20 o3 10.0% El o3 de OpenAI obtiene una puntuación más baja en FrontierMath de lo inicialmente afirmado
2025-03-17 o3-mini with high reasoning and a Python tool 32.0% La evaluación de Epoch de o3-mini en FrontierMath arroja 11% frente al 32% de OpenAI
2025-01-29 o3 25.0% El modelo o3 de OpenAI obtiene un 25% en la prueba Frontier Math
2025-01-19 o3 25.2% OpenAI financió el benchmark FrontierMath antes de que o3 estableciera un récord
2024-12-22 o3 25.0% o3 de OpenAI obtiene un 25% en el benchmark de matemáticas difíciles FrontierMath
2024-12-20 o3 25.0% OpenAI presenta el modelo de razonamiento o3 con avances en ARC AGI y Frontier Math
2024-12-20 OpenAI o3 25.2% Epoch AI
2024-11-08 Claude 3.5 Sonnet 2.0% Epoch AI lanza el benchmark FrontierMath para evaluar el razonamiento matemático avanzado
2024-11-08 Gemini 1.5 Pro 2.0% Epoch AI lanza el benchmark FrontierMath para evaluar el razonamiento matemático avanzado
2024-11-08 GPT-4o 2.0% Epoch AI lanza el benchmark FrontierMath para evaluar el razonamiento matemático avanzado
2024-11-08 o1-preview 2.0% Epoch AI lanza el benchmark FrontierMath para evaluar el razonamiento matemático avanzado