Los investigadores presentan MMLU-Pro, una versión mejorada del benchmark Massive Multitask Language Understanding diseñada para abordar la saturación del rendimiento y la inestabilidad en los modelos de lenguaje grandes actuales. El nuevo conjunto de datos amplía el conjunto de opciones de cuatro a diez, integra preguntas de razonamiento de nivel universitario desafiantes y elimina elementos ruidosos mediante revisión experta.
- La precisión disminuye entre un 16% y un 33% en comparación con MMLU, con el modelo principal GPT-4o obteniendo solo un 72,6%.
- La sensibilidad de la puntuación del modelo a las variaciones del prompt disminuye del 4-5% en MMLU a solo un 2% en MMLU-Pro a través de 24 estilos.
- El razonamiento de cadena de pensamiento mejora significativamente el rendimiento en MMLU-Pro, mejorando GPT-4o en un 19%, mientras que perjudica los resultados en el benchmark original.
- El benchmark abarca 14 dominios con más de 12.000 preguntas, proporcionando mayor poder discriminativo entre modelos como GPT-4o y GPT-4-Turbo.
MMLU-Pro sirve como una métrica más fiable y difícil para rastrear el progreso en las capacidades de comprensión y razonamiento lingüístico a nivel experto.