Benchmark · general

MMLU-Pro

11 resultados 10 modelos

MMLU-Pro es un sucesor más difícil y centrado en el razonamiento de MMLU que evalúa el conocimiento y la resolución de problemas de un modelo en muchas disciplinas académicas mediante preguntas de opción múltiple, cada una con 10 opciones de respuesta. El resultado se expresa como porcentaje de acierto: la proporción de preguntas respondidas correctamente.

Leer más
Ejemplo
Un ítem típico es una pregunta de opción múltiple de un campo como matemáticas, física, derecho o ingeniería que requiere varios pasos de razonamiento, donde el modelo debe elegir la única respuesta correcta entre 10 opciones (frente a 4 en el MMLU original).
Puntuación
La métrica es la exactitud (accuracy): el porcentaje de preguntas en las que el modelo elige la opción correcta, calculado como respuestas correctas dividido entre el total de preguntas.
Verificación
Cada respuesta se califica de forma automática comparando por coincidencia exacta la opción elegida por el modelo con la etiqueta correcta conocida, sin necesidad de evaluación humana.
Por qué importa
Como los modelos punteros casi habían saturado el MMLU original, las preguntas más difíciles y las 10 opciones de MMLU-Pro lo hacen más discriminante y más sensible al razonamiento real, ofreciendo una medida más limpia del progreso.
Ejemplo resuelto
Tarea
MMLU-Pro (física, 10 opciones). Un proyectil se lanza desde el nivel del suelo a 20 m/s con un ángulo de 30° sobre la horizontal (g = 10 m/s², sin resistencia del aire). ¿Cuál es su altura máxima? A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
Solución
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
Explicación
En el punto más alto la velocidad vertical es cero, por lo que h_max = v_y²/(2g) con v_y = v·sin30°; solo la componente vertical determina la altura. MMLU-Pro califica por coincidencia exacta de la letra elegida con la clave de referencia (accuracy sobre sus 10 opciones).
0 24 48 72 96 2024-06-03 2024-12-30 2025-07-28 GPT-4o · 72.6 · 2024-06-03 GPT-4o · 72.6 · 2024-06-03 GPT-4-Turbo · 63.7 · 2024-06-03 Claude 3.5 Sonnet · 90.4 · 2024-06-20 Falcon3-3B-Instruct · 29.7 · 2024-12-17 Falcon3-7B-Base · 39.2 · 2024-12-17 Falcon3-10B-Base · 42.5 · 2024-12-17 DeepSeek-V3-0324 · 81.2 · 2025-03-24 Gemini 2.0 Flash · 77.6 · 2025-04-15 Deepseek-R1-0528 · 85 · 2025-05-30 GLM-4.5 · 84.6 · 2025-07-28
GPT-4o GPT-4-Turbo Claude 3.5 Sonnet Falcon3-3B-Instruct Falcon3-7B-Base Falcon3-10B-Base DeepSeek-V3-0324 Gemini 2.0 Flash Deepseek-R1-0528 GLM-4.5
Cronología
Fecha Modelo Puntuación Fuente
2025-07-28 GLM-4.5 84.6% Zhipu AI lanza los modelos base GLM-4.5 y GLM-4.5-Air para agentes inteligentes
2025-05-30 Deepseek-R1-0528 85.0% DeepSeek actualiza el modelo R1 con mejor razonamiento y puntuaciones en benchmarks
2025-04-15 Gemini 2.0 Flash 77.6% Google lanza Gemini 2.0 Flash con calidad mejorada y el doble de velocidad que Gemini 1.5 Pro
2025-03-24 DeepSeek-V3-0324 81.2% DeepSeek-V3-0324 mejora el razonamiento, la programación y la escritura en chino respecto a DeepSeek-V3
2024-12-17 Falcon3-3B-Instruct 29.7% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código
2024-12-17 Falcon3-7B-Base 39.2% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código
2024-12-17 Falcon3-10B-Base 42.5% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código
2024-06-20 Claude 3.5 Sonnet 90.4% Anthropic lanza un apéndice de Claude 3.5 Sonnet con mejores benchmarks de codificación y visión
2024-06-03 GPT-4o 72.6% MMLU-Pro introduce un benchmark más robusto con 10 opciones y preguntas centradas en el razonamiento
2024-06-03 GPT-4-Turbo 63.7% MMLU-Pro introduce un benchmark más robusto con 10 opciones y preguntas centradas en el razonamiento
2024-06-03 GPT-4o 72.6% MMLU-Pro paper