研究人员推出了 MMLU-Pro,这是大规模多任务语言理解(Massive Multitask Language Understanding)基准的增强版本,旨在解决当前大型语言模型中出现的性能饱和和不稳定问题。新数据集将选项数量从四个扩展到十个,整合了具有挑战性的大学水平推理题目,并通过专家审核剔除了噪声数据。

  • 与 MMLU 相比,准确率下降了 16% 至 33%,顶级模型 GPT-4o 的得分仅为 72.6%。
  • 模型对提示词变化的分数敏感度从 MMLU 中的 4-5% 降至 MMLU-Pro 中仅 2%(涵盖24种风格)。
  • 思维链(Chain of Thought)推理显著提升了 MMLU-Pro 上的性能,使 GPT-4o 提高了 19%,而在原始基准测试中却对结果产生负面影响。
  • 该基准测试涵盖14个领域,包含超过12,000道题目,提供了更强的区分能力,例如在 GPT-4o 和 GPT-4-Turbo 之间。

MMLU-Pro 作为一个更可靠且更具挑战性的指标,用于追踪专家级语言理解和推理能力的进展。