Les chercheurs présentent MMLU-Pro, une version améliorée du benchmark Massive Multitask Language Understanding conçue pour répondre à la saturation des performances et à l'instabilité des grands modèles de langage actuels. Le nouvel ensemble de données élargit le nombre d'options de quatre à dix, intègre des questions de raisonnement de niveau universitaire difficiles, et élimine les éléments bruités grâce à un examen par des experts.
- La précision chute de 16 % à 33 % par rapport à MMLU, le modèle principal GPT-4o obtenant seulement 72,6 %.
- La sensibilité des scores des modèles aux variations d'invite diminue de 4-5 % dans MMLU à seulement 2 % dans MMLU-Pro sur 24 styles.
- Le raisonnement par chaîne de pensée améliore significativement les performances sur MMLU-Pro, améliorant GPT-4o de 19 %, tandis qu'il nuit aux résultats sur le benchmark original.
- Le benchmark couvre 14 domaines avec plus de 12 000 questions, offrant un pouvoir discriminatif supérieur entre des modèles comme GPT-4o et GPT-4-Turbo.
MMLU-Pro sert de métrique plus fiable et difficile pour suivre les progrès dans la compréhension et le raisonnement linguistiques de niveau expert.