Los investigadores presentan MMLU-Pro, una versión mejorada del benchmark Massive Multitask Language Understanding diseñada para abordar la saturación del rendimiento y la inestabilidad en los modelos de lenguaje grandes actuales. El nuevo conjunto de datos amplía el conjunto de opciones de cuatro a diez, integra preguntas de razonamiento de nivel universitario desafiantes y elimina elementos ruidosos mediante revisión experta.

  • La precisión disminuye entre un 16% y un 33% en comparación con MMLU, con el modelo principal GPT-4o obteniendo solo un 72,6%.
  • La sensibilidad de la puntuación del modelo a las variaciones del prompt disminuye del 4-5% en MMLU a solo un 2% en MMLU-Pro a través de 24 estilos.
  • El razonamiento de cadena de pensamiento mejora significativamente el rendimiento en MMLU-Pro, mejorando GPT-4o en un 19%, mientras que perjudica los resultados en el benchmark original.
  • El benchmark abarca 14 dominios con más de 12.000 preguntas, proporcionando mayor poder discriminativo entre modelos como GPT-4o y GPT-4-Turbo.

MMLU-Pro sirve como una métrica más fiable y difícil para rastrear el progreso en las capacidades de comprensión y razonamiento lingüístico a nivel experto.