Benchmark · general

MMLU

saturated 15 条结果 12 个模型

MMLU(Massive Multitask Language Understanding)通过多项选择题考查模型在 57 个学科上的知识广度——涵盖历史、法律、数学、医学等。成绩以准确率(% accuracy)表示,即答对题目所占的比例。

了解更多
示例
一道典型题目给出一个问题和四个带标号的选项(A–D),模型需选出正确答案——例如一道大学水平的医学题或一道小学数学题。
评分方式
指标是准确率(accuracy):模型选对选项的多项选择题所占百分比,并在全部 57 个学科上取平均。
验证方式
评分是自动且客观的——将模型所选的字母与已知正确答案做精确匹配(exact-match),无需人工判断。
为何重要
MMLU 曾是衡量通用知识与推理广度的标准标尺,但如今顶尖模型得分极高,基准已基本饱和,越来越难以区分最强的系统。
示例解析
任务
以下是一道关于高中化学的多项选择题。下列哪一项是强酸? A) HF B) HCl C) CH3COOH D) H2CO3
解答
HCl 在水中完全电离,因此是强酸;HF、CH3COOH 和 H2CO3 只部分电离(弱酸)。最终答案:B) HCl。
解析
强酸在水溶液中完全解离为 H+ 及其共轭碱,HCl 符合而其他几项不符合。MMLU 按精确匹配准确率评分:模型选出的选项字母必须与标准答案(B)一致。
0 24 48 72 96 2023-03-14 2024-03-29 2025-04-15 Gemini Ultra · 90 · 2023-12-06 Gemini Ultra · 90 · 2023-12-06 Qwen2-72B · 84.2 · 2024-07-15 Qwen2-72B · 84.2 · 2024-07-15 Mistral Large 2 · 84 · 2024-07-24 Mistral Large 2 · 84 · 2024-07-25 Falcon3-10B-Base · 73.1 · 2024-12-17 Falcon3-7B-Base · 67.4 · 2024-12-17 Claude 3.7 Sonnet · 86.1 · 2025-02-24 GPT‑4.1 nano · 80.1 · 2025-04-14 Gemini 2.0 Flash · 83.4 · 2025-04-15 GPT-3.5 · 70 · 2023-03-14 GPT-4 · 86.4 · 2023-03-14 Claude 2 · 78.5 · 2023-07-11 Claude 3 Opus · 86.8 · 2024-03-04
Gemini Ultra Qwen2-72B Mistral Large 2 Falcon3-10B-Base Falcon3-7B-Base Claude 3.7 Sonnet GPT‑4.1 nano Gemini 2.0 Flash GPT-3.5 GPT-4 Claude 2 Claude 3 Opus
时间线
日期 模型 得分 来源
2025-04-15 Gemini 2.0 Flash 83.4% Google 发布 Gemini 2.0 Flash,质量提升且速度是 Gemini 1.5 Pro 的两倍
2025-04-14 GPT‑4.1 nano 80.1% OpenAI在API中推出GPT-4.1、GPT-4.1 mini和GPT-4.1 nano
2025-02-24 Claude 3.7 Sonnet 86.1% Anthropic 发布 Claude 3.7 Sonnet,支持动态推理控制
2024-12-17 Falcon3-10B-Base 73.1% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力
2024-12-17 Falcon3-7B-Base 67.4% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力
2024-07-25 Mistral Large 2 84.0% Mistral 发布 Mistral Large 2,支持 128K 上下文并增强多语言支持
2024-07-24 Mistral Large 2 84.0% Mistral 发布拥有 123B 参数的大模型 Large 2,实现高性价比的单节点推理
2024-07-15 Qwen2-72B 84.2% Qwen团队发布Qwen2系列,包含72B密集模型和MoE模型
2024-07-15 Qwen2-72B 84.2% Qwen2 技术报告介绍高达 72B 的密集和 MoE 模型
2024-03-04 Claude 3 Opus 86.8% Anthropic
2023-12-06 Gemini Ultra 90.0% Google推出Gemini 1.0,其最大的多模态AI模型
2023-12-06 Gemini Ultra 90.0% Google
2023-07-11 Claude 2 78.5% Anthropic
2023-03-14 GPT-3.5 70.0% OpenAI
2023-03-14 GPT-4 86.4% OpenAI