Исследователи представляют MMLU-Pro, улучшенную версию бенчмарка Massive Multitask Language Understanding, предназначенную для решения проблем насыщения производительности и нестабильности в современных больших языковых моделях. Новый набор данных расширяет количество вариантов ответа с четырех до десяти, включает сложные вопросы на рассуждения университетского уровня и устраняет зашумленные элементы посредством экспертной проверки.

  • Точность снижается на 16%–33% по сравнению с MMLU, при этом лучшая модель GPT-4o набирает всего 72.6%.
  • Чувствительность оценок моделей к вариациям промпта снижается с 4–5% в MMLU до всего 2% в MMLU-Pro по 24 стилям.
  • Цепочка рассуждений (Chain of Thought) значительно повышает производительность на MMLU-Pro, улучшая результат GPT-4o на 19%, тогда как она ухудшает результаты на исходном бенчмарке.
  • Бенчмарк охватывает 14 областей с более чем 12 000 вопросов, обеспечивая большую дискриминационную способность между моделями, такими как GPT-4o и GPT-4-Turbo.

MMLU-Pro служит более надежным и сложным метрическим показателем для отслеживания прогресса в понимании языка и способностях к рассуждениям на экспертном уровне.