ベンチマーク · general
MMLU
MMLU(Massive Multitask Language Understanding)は、歴史や法律から数学、医学まで57分野にわたる多肢選択問題で、モデルの知識の幅を測るベンチマークです。結果は正答率(% accuracy)、つまり正しく答えた問題の割合で示されます。
詳しく見る
- 例
- 典型的な問題は、設問と4つのラベル付き選択肢(A–D)から成り、モデルは正しいものを選びます——たとえば大学レベルの医学の問題や、小学校レベルの算数の問題などです。
- 採点方法
- 指標は正答率(accuracy)で、モデルが正しい選択肢を選んだ多肢選択問題の割合を、57分野すべてで平均して算出します。
- 検証方法
- 採点は自動かつ客観的で、モデルが選んだ記号を既知の正解と完全一致(exact-match)で照合するため、人手による判断は不要です。
- 重要な理由
- MMLUは一般知識と推論の幅を測る標準的なものさしになりましたが、いまや上位モデルの得点が非常に高く、ほぼ飽和しており、最上位システムを見分けにくくなっています。
解説付きの例
課題
以下は高校化学に関する多肢選択問題です。次のうち強酸はどれですか。 A) HF B) HCl C) CH3COOH D) H2CO3
解答
HCl は水中で完全に電離するため強酸であり、HF、CH3COOH、H2CO3 は部分的にしか電離しない(弱酸)。最終解答:B) HCl。
解説
強酸は水溶液中で H+ と共役塩基へ完全に解離し、HCl はこれに該当するが他は該当しない。MMLU は完全一致の正解率で採点し、選んだ選択肢の記号が正解ラベル(B)と一致しなければならない。
| 日付 | モデル | スコア | ソース |
|---|---|---|---|
| 2025-04-15 | Gemini 2.0 Flash | 83.4% | Google、Gemini 1.5 Proの2倍の速度と向上した品質を持つGemini 2.0 Flashをリリース |
| 2025-04-14 | GPT‑4.1 nano | 80.1% | OpenAIがAPIでGPT-4.1、GPT-4.1 mini、GPT-4.1 nanoをリリース |
| 2025-02-24 | Claude 3.7 Sonnet | 86.1% | Anthropicが動的推論制御機能を備えたClaude 3.7 Sonnetをリリース |
| 2024-12-17 | Falcon3-10B-Base | 73.1% | Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース |
| 2024-12-17 | Falcon3-7B-Base | 67.4% | Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース |
| 2024-07-25 | Mistral Large 2 | 84.0% | Mistral、128Kのコンテキストと改善された多言語サポートを備えた「Mistral Large 2」をリリース |
| 2024-07-24 | Mistral Large 2 | 84.0% | Mistralが123BパラメータのLarge 2をリリース、単一ノード推論のコスト効率を実現 |
| 2024-07-15 | Qwen2-72B | 84.2% | Qwenチームが72BのDenseおよびMoEモデルを含むQwen2シリーズをリリース |
| 2024-07-15 | Qwen2-72B | 84.2% | Qwen2技術レポートは72Bまでの密集型およびMoEモデルを紹介 |
| 2024-03-04 | Claude 3 Opus | 86.8% | Anthropic |
| 2023-12-06 | Gemini Ultra | 90.0% | Google、最大規模のマルチモーダルAIモデル「Gemini 1.0」を発表 |
| 2023-12-06 | Gemini Ultra | 90.0% | |
| 2023-07-11 | Claude 2 | 78.5% | Anthropic |
| 2023-03-14 | GPT-3.5 | 70.0% | OpenAI |
| 2023-03-14 | GPT-4 | 86.4% | OpenAI |