Pesquisadores apresentam o MMLU-Pro, uma versão aprimorada do benchmark Massive Multitask Language Understanding, projetado para abordar a saturação de desempenho e a instabilidade nos atuais modelos de linguagem grandes. O novo conjunto de dados expande o conjunto de opções de quatro para dez, integra perguntas desafiadoras de raciocínio de nível universitário e elimina itens ruidosos por meio de revisão especializada.

  • A queda na precisão é de 16% a 33% em comparação com o MMLU, com o modelo principal GPT-4o marcando apenas 72,6%.
  • A sensibilidade da pontuação do modelo às variações de prompt diminui de 4-5% no MMLU para apenas 2% no MMLU-Pro em 24 estilos.
  • O raciocínio Chain of Thought aumenta significativamente o desempenho no MMLU-Pro, melhorando o GPT-4o em 19%, enquanto prejudica os resultados no benchmark original.
  • O benchmark abrange 14 domínios com mais de 12.000 perguntas, oferecendo maior poder discriminativo entre modelos como GPT-4o e GPT-4-Turbo.

O MMLU-Pro serve como uma métrica mais confiável e difícil para acompanhar o progresso nas capacidades de compreensão e raciocínio de linguagem em nível de especialista.