Benchmark · multimodal

MMMU

8 resultados 7 modelos

MMMU (Massive Multi-discipline Multimodal Understanding) evalúa si un modelo puede responder preguntas de nivel universitario que combinan imágenes y texto de muchas disciplinas académicas. El resultado se expresa como porcentaje de respuestas correctas (exactitud).

Leer más
Ejemplo
Una pregunta puede mostrar un diagrama de química, un gráfico o una imagen médica junto con texto y pedir al modelo que razone y elija la respuesta correcta, como un ítem de un examen universitario.
Puntuación
Cada pregunta se marca como correcta o incorrecta, y la puntuación es el porcentaje de preguntas respondidas correctamente (exactitud).
Verificación
Las respuestas se verifican de forma automática por coincidencia exacta con la respuesta de referencia (en su mayoría opción múltiple, algunas respuestas abiertas cortas), sin necesidad de evaluación humana.
Por qué importa
Mide el razonamiento experto de nivel universitario sobre imágenes y texto en decenas de materias, lo que lo convierte en una prueba exigente de comprensión multimodal real y no solo de habilidad con texto.
Ejemplo resuelto
Tarea
(Imagen: un diagrama de circuito — una batería de 12 V en un solo lazo con dos resistencias en serie, R1 = 4 Ω y R2 = 8 Ω.) ¿Cuál es la corriente que pasa por la resistencia R2? Opciones: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
Solución
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
Explicación
En un circuito en serie circula la misma corriente por todos los elementos y la resistencia total es la suma de las partes, así que I = 12/12 = 1.0 A. MMMU lo califica por coincidencia exacta entre la letra de la opción predicha y la única respuesta correcta.
0 22.5 45 67.5 90 2023-11-27 2024-10-01 2025-08-07 Gemini 2.5 Pro · 81.7 · 2025-03-26 Gemini 2.0 Flash · 71.7 · 2025-04-15 o4-mini · 81.6 · 2025-04-17 GPT-5 · 84.2 · 2025-08-07 GPT-5 · 84.2 · 2025-08-07 GPT-4V · 56.8 · 2023-11-27 Claude 3 Opus · 59.4 · 2024-03-04 GPT-4o · 69.1 · 2024-05-13
Gemini 2.5 Pro Gemini 2.0 Flash o4-mini GPT-5 GPT-4V Claude 3 Opus GPT-4o
Cronología
Fecha Modelo Puntuación Fuente
2025-08-07 GPT-5 84.2% OpenAI presenta GPT-5 con enrutamiento unificado y razonamiento de nivel experto
2025-08-07 GPT-5 84.2% OpenAI lanza GPT-5 con razonamiento adaptativo y arquitectura unificada
2025-04-17 o4-mini 81.6% OpenAI lanza o4-mini, un modelo de razonamiento multimodal más rápido y económico
2025-04-15 Gemini 2.0 Flash 71.7% Google lanza Gemini 2.0 Flash con calidad mejorada y el doble de velocidad que Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 81.7% Google lanza el modelo de razonamiento experimental Gemini 2.5 Pro con contexto de 1M tokens
2024-05-13 GPT-4o 69.1% OpenAI
2024-03-04 Claude 3 Opus 59.4% Anthropic
2023-11-27 GPT-4V 56.8% MMMU paper