Benchmark · general
MMLU
MMLU (Massive Multitask Language Understanding) evalúa la amplitud de conocimientos de un modelo en 57 materias —desde historia y derecho hasta matemáticas y medicina— mediante preguntas de opción múltiple. El resultado se expresa como % de acierto: la proporción de preguntas respondidas correctamente.
Leer más
- Ejemplo
- Un ítem típico presenta una pregunta y cuatro opciones etiquetadas (A–D), y el modelo debe elegir la correcta; por ejemplo, una pregunta de medicina de nivel universitario o un problema de matemáticas elemental.
- Puntuación
- La métrica es la exactitud (accuracy): el porcentaje de preguntas de opción múltiple en las que el modelo elige la opción correcta, promediado sobre las 57 materias.
- Verificación
- La calificación es automática y objetiva: la letra elegida por el modelo se compara por coincidencia exacta con la respuesta correcta conocida, sin necesidad de juicio humano.
- Por qué importa
- MMLU se convirtió en una vara estándar para medir la amplitud de conocimientos y razonamiento, pero los mejores modelos obtienen puntuaciones tan altas que está en gran medida saturado y distingue peor a los mejores sistemas.
Ejemplo resuelto
Tarea
La siguiente es una pregunta de opción múltiple sobre química de secundaria. ¿Cuál de los siguientes es un ácido fuerte? A) HF B) HCl C) CH3COOH D) H2CO3
Solución
HCl se ioniza por completo en agua, por lo que es un ácido fuerte; HF, CH3COOH y H2CO3 se ionizan solo parcialmente (ácidos débiles). Respuesta final: B) HCl.
Explicación
Un ácido fuerte se disocia totalmente en H+ y su base conjugada en disolución acuosa, cosa que hace HCl pero no los demás. MMLU lo califica por exactitud de coincidencia exacta: la letra de la opción elegida debe ser igual a la etiqueta correcta (B).