Benchmark · general

MMLU

saturated 15 resultados 12 modelos

MMLU (Massive Multitask Language Understanding) evalúa la amplitud de conocimientos de un modelo en 57 materias —desde historia y derecho hasta matemáticas y medicina— mediante preguntas de opción múltiple. El resultado se expresa como % de acierto: la proporción de preguntas respondidas correctamente.

Leer más
Ejemplo
Un ítem típico presenta una pregunta y cuatro opciones etiquetadas (A–D), y el modelo debe elegir la correcta; por ejemplo, una pregunta de medicina de nivel universitario o un problema de matemáticas elemental.
Puntuación
La métrica es la exactitud (accuracy): el porcentaje de preguntas de opción múltiple en las que el modelo elige la opción correcta, promediado sobre las 57 materias.
Verificación
La calificación es automática y objetiva: la letra elegida por el modelo se compara por coincidencia exacta con la respuesta correcta conocida, sin necesidad de juicio humano.
Por qué importa
MMLU se convirtió en una vara estándar para medir la amplitud de conocimientos y razonamiento, pero los mejores modelos obtienen puntuaciones tan altas que está en gran medida saturado y distingue peor a los mejores sistemas.
Ejemplo resuelto
Tarea
La siguiente es una pregunta de opción múltiple sobre química de secundaria. ¿Cuál de los siguientes es un ácido fuerte? A) HF B) HCl C) CH3COOH D) H2CO3
Solución
HCl se ioniza por completo en agua, por lo que es un ácido fuerte; HF, CH3COOH y H2CO3 se ionizan solo parcialmente (ácidos débiles). Respuesta final: B) HCl.
Explicación
Un ácido fuerte se disocia totalmente en H+ y su base conjugada en disolución acuosa, cosa que hace HCl pero no los demás. MMLU lo califica por exactitud de coincidencia exacta: la letra de la opción elegida debe ser igual a la etiqueta correcta (B).
0 24 48 72 96 2023-03-14 2024-03-29 2025-04-15 Gemini Ultra · 90 · 2023-12-06 Gemini Ultra · 90 · 2023-12-06 Qwen2-72B · 84.2 · 2024-07-15 Qwen2-72B · 84.2 · 2024-07-15 Mistral Large 2 · 84 · 2024-07-24 Mistral Large 2 · 84 · 2024-07-25 Falcon3-10B-Base · 73.1 · 2024-12-17 Falcon3-7B-Base · 67.4 · 2024-12-17 Claude 3.7 Sonnet · 86.1 · 2025-02-24 GPT‑4.1 nano · 80.1 · 2025-04-14 Gemini 2.0 Flash · 83.4 · 2025-04-15 GPT-3.5 · 70 · 2023-03-14 GPT-4 · 86.4 · 2023-03-14 Claude 2 · 78.5 · 2023-07-11 Claude 3 Opus · 86.8 · 2024-03-04
Gemini Ultra Qwen2-72B Mistral Large 2 Falcon3-10B-Base Falcon3-7B-Base Claude 3.7 Sonnet GPT‑4.1 nano Gemini 2.0 Flash GPT-3.5 GPT-4 Claude 2 Claude 3 Opus
Cronología
Fecha Modelo Puntuación Fuente
2025-04-15 Gemini 2.0 Flash 83.4% Google lanza Gemini 2.0 Flash con calidad mejorada y el doble de velocidad que Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 80.1% OpenAI lanza GPT-4.1, GPT-4.1 mini y GPT-4.1 nano en la API
2025-02-24 Claude 3.7 Sonnet 86.1% Anthropic lanza Claude 3.7 Sonnet con control dinámico de razonamiento
2024-12-17 Falcon3-10B-Base 73.1% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código
2024-12-17 Falcon3-7B-Base 67.4% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código
2024-07-25 Mistral Large 2 84.0% Mistral lanza Mistral Large 2 con contexto de 128K y soporte multilingüe mejorado
2024-07-24 Mistral Large 2 84.0% Mistral lanza Large 2 con 123B parámetros para inferencia en un solo nodo eficiente en costos
2024-07-15 Qwen2-72B 84.2% El equipo de Qwen lanza la serie Qwen2 con modelos densos y MoE de 72B
2024-07-15 Qwen2-72B 84.2% El informe técnico de Qwen2 presenta modelos densos y MoE de hasta 72B
2024-03-04 Claude 3 Opus 86.8% Anthropic
2023-12-06 Gemini Ultra 90.0% Google presenta Gemini 1.0, su modelo de IA multimodal más grande
2023-12-06 Gemini Ultra 90.0% Google
2023-07-11 Claude 2 78.5% Anthropic
2023-03-14 GPT-3.5 70.0% OpenAI
2023-03-14 GPT-4 86.4% OpenAI