ベンチマーク · general

MMLU

saturated 15 結果 12 モデル

MMLU(Massive Multitask Language Understanding)は、歴史や法律から数学、医学まで57分野にわたる多肢選択問題で、モデルの知識の幅を測るベンチマークです。結果は正答率(% accuracy)、つまり正しく答えた問題の割合で示されます。

詳しく見る
典型的な問題は、設問と4つのラベル付き選択肢(A–D)から成り、モデルは正しいものを選びます——たとえば大学レベルの医学の問題や、小学校レベルの算数の問題などです。
採点方法
指標は正答率(accuracy)で、モデルが正しい選択肢を選んだ多肢選択問題の割合を、57分野すべてで平均して算出します。
検証方法
採点は自動かつ客観的で、モデルが選んだ記号を既知の正解と完全一致(exact-match)で照合するため、人手による判断は不要です。
重要な理由
MMLUは一般知識と推論の幅を測る標準的なものさしになりましたが、いまや上位モデルの得点が非常に高く、ほぼ飽和しており、最上位システムを見分けにくくなっています。
解説付きの例
課題
以下は高校化学に関する多肢選択問題です。次のうち強酸はどれですか。 A) HF B) HCl C) CH3COOH D) H2CO3
解答
HCl は水中で完全に電離するため強酸であり、HF、CH3COOH、H2CO3 は部分的にしか電離しない(弱酸)。最終解答:B) HCl。
解説
強酸は水溶液中で H+ と共役塩基へ完全に解離し、HCl はこれに該当するが他は該当しない。MMLU は完全一致の正解率で採点し、選んだ選択肢の記号が正解ラベル(B)と一致しなければならない。
0 24 48 72 96 2023-03-14 2024-03-29 2025-04-15 Gemini Ultra · 90 · 2023-12-06 Gemini Ultra · 90 · 2023-12-06 Qwen2-72B · 84.2 · 2024-07-15 Qwen2-72B · 84.2 · 2024-07-15 Mistral Large 2 · 84 · 2024-07-24 Mistral Large 2 · 84 · 2024-07-25 Falcon3-10B-Base · 73.1 · 2024-12-17 Falcon3-7B-Base · 67.4 · 2024-12-17 Claude 3.7 Sonnet · 86.1 · 2025-02-24 GPT‑4.1 nano · 80.1 · 2025-04-14 Gemini 2.0 Flash · 83.4 · 2025-04-15 GPT-3.5 · 70 · 2023-03-14 GPT-4 · 86.4 · 2023-03-14 Claude 2 · 78.5 · 2023-07-11 Claude 3 Opus · 86.8 · 2024-03-04
Gemini Ultra Qwen2-72B Mistral Large 2 Falcon3-10B-Base Falcon3-7B-Base Claude 3.7 Sonnet GPT‑4.1 nano Gemini 2.0 Flash GPT-3.5 GPT-4 Claude 2 Claude 3 Opus
タイムライン
日付 モデル スコア ソース
2025-04-15 Gemini 2.0 Flash 83.4% Google、Gemini 1.5 Proの2倍の速度と向上した品質を持つGemini 2.0 Flashをリリース
2025-04-14 GPT‑4.1 nano 80.1% OpenAIがAPIでGPT-4.1、GPT-4.1 mini、GPT-4.1 nanoをリリース
2025-02-24 Claude 3.7 Sonnet 86.1% Anthropicが動的推論制御機能を備えたClaude 3.7 Sonnetをリリース
2024-12-17 Falcon3-10B-Base 73.1% Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース
2024-12-17 Falcon3-7B-Base 67.4% Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース
2024-07-25 Mistral Large 2 84.0% Mistral、128Kのコンテキストと改善された多言語サポートを備えた「Mistral Large 2」をリリース
2024-07-24 Mistral Large 2 84.0% Mistralが123BパラメータのLarge 2をリリース、単一ノード推論のコスト効率を実現
2024-07-15 Qwen2-72B 84.2% Qwenチームが72BのDenseおよびMoEモデルを含むQwen2シリーズをリリース
2024-07-15 Qwen2-72B 84.2% Qwen2技術レポートは72Bまでの密集型およびMoEモデルを紹介
2024-03-04 Claude 3 Opus 86.8% Anthropic
2023-12-06 Gemini Ultra 90.0% Google、最大規模のマルチモーダルAIモデル「Gemini 1.0」を発表
2023-12-06 Gemini Ultra 90.0% Google
2023-07-11 Claude 2 78.5% Anthropic
2023-03-14 GPT-3.5 70.0% OpenAI
2023-03-14 GPT-4 86.4% OpenAI