Benchmark · multimodal

MMMU-Pro

11 resultados 8 modelos

MMMU-Pro es una versión reforzada en robustez del benchmark MMMU que mide la comprensión y el razonamiento multimodal (imagen + texto) de nivel universitario en seis disciplinas; la métrica es la exactitud en preguntas de opción múltiple.

Leer más
Ejemplo
Una pregunta de una disciplina combina una imagen —un diagrama, un gráfico, una estructura química o una imagen médica— con una pregunta de nivel universitario y hasta 10 opciones de respuesta; en el modo de solo visión, toda la pregunta y sus opciones van incrustadas dentro de una captura de pantalla o una foto, de modo que el modelo debe leer el texto de la propia imagen.
Puntuación
Exactitud: la opción elegida por el modelo se compara por coincidencia exacta con la clave de referencia y la puntuación es el porcentaje de ítems respondidos correctamente. Las opciones candidatas se amplían de 4 a 10 para dificultar el acierto al azar, y la puntuación global de MMMU-Pro promedia los modos Standard (10 opciones) y Vision (entrada por imagen) (normalmente se usa razonamiento en cadena, Chain-of-Thought).
Verificación
Cada ítem es de opción múltiple con una sola respuesta correcta, así que la calificación es automática: la opción final elegida se extrae de la salida del modelo (a menudo con cadena de razonamiento) y se compara por coincidencia exacta con la respuesta de referencia. La robustez está integrada en los datos —se filtran las preguntas que los modelos de solo texto pueden responder y se eleva el número de opciones a 10—, de modo que una puntuación alta refleja un razonamiento multimodal genuino y no atajos textuales ni aciertos por suerte.
Por qué importa
El MMMU original inflaba las puntuaciones porque los modelos podían explotar atajos de solo texto o acertar entre cuatro opciones; MMMU-Pro elimina ambas cosas, por lo que la exactitud medida cae bruscamente y separa mejor a los modelos que de verdad integran visión y texto, lo que lo convierte en una medida más honesta de la capacidad multimodal de nivel experto.
Ejemplo resuelto
Tarea
Ítem representativo de Ciencia (Física) en formato MMMU-Pro. [Imagen: un bloque sobre un plano inclinado sin rozamiento con ángulo θ = 30°.] Pregunta: ¿cuál es la magnitud de la aceleración del bloque a lo largo del plano inclinado? Opciones (10): (A) 0 m/s² (B) 1.6 m/s² (C) 2.5 m/s² (D) 3.3 m/s² (E) 4.9 m/s² (F) 5.7 m/s² (G) 6.9 m/s² (H) 7.4 m/s² (I) 8.5 m/s² (J) 9.8 m/s². En el modo de solo visión, todo este enunciado aparece incrustado dentro de una captura de pantalla.
Solución
a = g·sin θ = 9.8 × sin 30° = 9.8 × 0.5 = 4.9 m/s² → (E)
Explicación
En un plano inclinado sin rozamiento, la única fuerza que actúa a lo largo de la superficie es la componente de la gravedad mg·sin θ, por lo que la aceleración es g·sin θ e independiente de la masa del bloque; g·sin 30° = 4.9 m/s², que corresponde a la opción (E). La calificación compara por coincidencia exacta la letra de la opción extraída con la clave de referencia.
0 22.5 45 67.5 90 2023-12-06 2025-04-04 2026-08-03 Gemini Ultra · 59.4 · 2023-12-06 Claude 3.5 Sonnet · 68.3 · 2024-06-20 o1 · 78.2 · 2024-09-12 Gemini 2.5 Pro Deep Think · 84 · 2025-05-20 Gemini 3 Pro · 81 · 2025-11-18 Gemini 3 Pro · 81 · 2025-11-18 Claude Opus 4.6 · 73.9 · 2026-02-05 Claude Opus 4.6 · 70.6 · 2026-02-05 Claude Opus 4.6 · 70.6 · 2026-03-06 Kimi K3 · 81.6 · 2026-07-17 Inkling-Small · 74 · 2026-08-03
Gemini Ultra Claude 3.5 Sonnet o1 Gemini 2.5 Pro Deep Think Gemini 3 Pro Claude Opus 4.6 Kimi K3 Inkling-Small
Cronología
Fecha Modelo Puntuación Fuente
2026-08-03 Inkling-Small 74.0% Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B
2026-07-17 Kimi K3 81.6% Moonshot AI lanza Kimi K3 abierto, un modelo MoE de 2.8T parámetros con contexto de 1M
2026-03-06 Claude Opus 4.6 70.6% Anthropic publica la tarjeta del sistema de Claude Opus 4.6 detallando capacidades y evaluaciones de seguridad
2026-02-05 Claude Opus 4.6 73.9% Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
2026-02-05 Claude Opus 4.6 70.6% Anthropic publica la tarjeta del sistema de Claude Opus 4.6 detallando capacidades y evaluaciones de seguridad
2025-11-18 Gemini 3 Pro 81.0% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-11-18 Gemini 3 Pro 81.0% Google lanza Gemini 3 Pro con capacidades de razonamiento y multimodales de última generación
2025-05-20 Gemini 2.5 Pro Deep Think 84.0% Google DeepMind actualiza Gemini 2.5 con Deep Think, salida de audio y uso del ordenador
2024-09-12 o1 78.2% OpenAI lanza o1-preview, un modelo de razonamiento que supera a expertos humanos en pruebas de matemáticas y ciencias
2024-06-20 Claude 3.5 Sonnet 68.3% Anthropic lanza un apéndice de Claude 3.5 Sonnet con mejores benchmarks de codificación y visión
2023-12-06 Gemini Ultra 59.4% Google presenta Gemini 1.0, su modelo de IA multimodal más grande