Benchmark · general
MMLU
MMLU(Massive Multitask Language Understanding)通过多项选择题考查模型在 57 个学科上的知识广度——涵盖历史、法律、数学、医学等。成绩以准确率(% accuracy)表示,即答对题目所占的比例。
了解更多
- 示例
- 一道典型题目给出一个问题和四个带标号的选项(A–D),模型需选出正确答案——例如一道大学水平的医学题或一道小学数学题。
- 评分方式
- 指标是准确率(accuracy):模型选对选项的多项选择题所占百分比,并在全部 57 个学科上取平均。
- 验证方式
- 评分是自动且客观的——将模型所选的字母与已知正确答案做精确匹配(exact-match),无需人工判断。
- 为何重要
- MMLU 曾是衡量通用知识与推理广度的标准标尺,但如今顶尖模型得分极高,基准已基本饱和,越来越难以区分最强的系统。
示例解析
任务
以下是一道关于高中化学的多项选择题。下列哪一项是强酸? A) HF B) HCl C) CH3COOH D) H2CO3
解答
HCl 在水中完全电离,因此是强酸;HF、CH3COOH 和 H2CO3 只部分电离(弱酸)。最终答案:B) HCl。
解析
强酸在水溶液中完全解离为 H+ 及其共轭碱,HCl 符合而其他几项不符合。MMLU 按精确匹配准确率评分:模型选出的选项字母必须与标准答案(B)一致。
| 日期 | 模型 | 得分 | 来源 |
|---|---|---|---|
| 2025-04-15 | Gemini 2.0 Flash | 83.4% | Google 发布 Gemini 2.0 Flash,质量提升且速度是 Gemini 1.5 Pro 的两倍 |
| 2025-04-14 | GPT‑4.1 nano | 80.1% | OpenAI在API中推出GPT-4.1、GPT-4.1 mini和GPT-4.1 nano |
| 2025-02-24 | Claude 3.7 Sonnet | 86.1% | Anthropic 发布 Claude 3.7 Sonnet,支持动态推理控制 |
| 2024-12-17 | Falcon3-10B-Base | 73.1% | Falcon3 系列发布五款开源模型,提升科学、数学和代码能力 |
| 2024-12-17 | Falcon3-7B-Base | 67.4% | Falcon3 系列发布五款开源模型,提升科学、数学和代码能力 |
| 2024-07-25 | Mistral Large 2 | 84.0% | Mistral 发布 Mistral Large 2,支持 128K 上下文并增强多语言支持 |
| 2024-07-24 | Mistral Large 2 | 84.0% | Mistral 发布拥有 123B 参数的大模型 Large 2,实现高性价比的单节点推理 |
| 2024-07-15 | Qwen2-72B | 84.2% | Qwen团队发布Qwen2系列,包含72B密集模型和MoE模型 |
| 2024-07-15 | Qwen2-72B | 84.2% | Qwen2 技术报告介绍高达 72B 的密集和 MoE 模型 |
| 2024-03-04 | Claude 3 Opus | 86.8% | Anthropic |
| 2023-12-06 | Gemini Ultra | 90.0% | Google推出Gemini 1.0,其最大的多模态AI模型 |
| 2023-12-06 | Gemini Ultra | 90.0% | |
| 2023-07-11 | Claude 2 | 78.5% | Anthropic |
| 2023-03-14 | GPT-3.5 | 70.0% | OpenAI |
| 2023-03-14 | GPT-4 | 86.4% | OpenAI |