Benchmark · multimodal
MMMU
MMMU (Massive Multi-discipline Multimodal Understanding) evalúa si un modelo puede responder preguntas de nivel universitario que combinan imágenes y texto de muchas disciplinas académicas. El resultado se expresa como porcentaje de respuestas correctas (exactitud).
Leer más
- Ejemplo
- Una pregunta puede mostrar un diagrama de química, un gráfico o una imagen médica junto con texto y pedir al modelo que razone y elija la respuesta correcta, como un ítem de un examen universitario.
- Puntuación
- Cada pregunta se marca como correcta o incorrecta, y la puntuación es el porcentaje de preguntas respondidas correctamente (exactitud).
- Verificación
- Las respuestas se verifican de forma automática por coincidencia exacta con la respuesta de referencia (en su mayoría opción múltiple, algunas respuestas abiertas cortas), sin necesidad de evaluación humana.
- Por qué importa
- Mide el razonamiento experto de nivel universitario sobre imágenes y texto en decenas de materias, lo que lo convierte en una prueba exigente de comprensión multimodal real y no solo de habilidad con texto.
Ejemplo resuelto
Tarea
(Imagen: un diagrama de circuito — una batería de 12 V en un solo lazo con dos resistencias en serie, R1 = 4 Ω y R2 = 8 Ω.) ¿Cuál es la corriente que pasa por la resistencia R2? Opciones: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
Solución
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
Explicación
En un circuito en serie circula la misma corriente por todos los elementos y la resistencia total es la suma de las partes, así que I = 12/12 = 1.0 A. MMMU lo califica por coincidencia exacta entre la letra de la opción predicha y la única respuesta correcta.
| Fecha | Modelo | Puntuación | Fuente |
|---|---|---|---|
| 2025-08-07 | GPT-5 | 84.2% | OpenAI presenta GPT-5 con enrutamiento unificado y razonamiento de nivel experto |
| 2025-08-07 | GPT-5 | 84.2% | OpenAI lanza GPT-5 con razonamiento adaptativo y arquitectura unificada |
| 2025-04-17 | o4-mini | 81.6% | OpenAI lanza o4-mini, un modelo de razonamiento multimodal más rápido y económico |
| 2025-04-15 | Gemini 2.0 Flash | 71.7% | Google lanza Gemini 2.0 Flash con calidad mejorada y el doble de velocidad que Gemini 1.5 Pro |
| 2025-03-26 | Gemini 2.5 Pro | 81.7% | Google lanza el modelo de razonamiento experimental Gemini 2.5 Pro con contexto de 1M tokens |
| 2024-05-13 | GPT-4o | 69.1% | OpenAI |
| 2024-03-04 | Claude 3 Opus | 59.4% | Anthropic |
| 2023-11-27 | GPT-4V | 56.8% | MMMU paper |