ベンチマーク · general
MMLU
MMLU(Massive Multitask Language Understanding)は、歴史や法律から数学、医学まで57分野にわたる多肢選択問題で、モデルの知識の幅を測るベンチマークです。結果は正答率(% accuracy)、つまり正しく答えた問題の割合で示されます。
詳しく見る
- 例
- 典型的な問題は、設問と4つのラベル付き選択肢(A–D)から成り、モデルは正しいものを選びます——たとえば大学レベルの医学の問題や、小学校レベルの算数の問題などです。
- 採点方法
- 指標は正答率(accuracy)で、モデルが正しい選択肢を選んだ多肢選択問題の割合を、57分野すべてで平均して算出します。
- 検証方法
- 採点は自動かつ客観的で、モデルが選んだ記号を既知の正解と完全一致(exact-match)で照合するため、人手による判断は不要です。
- 重要な理由
- MMLUは一般知識と推論の幅を測る標準的なものさしになりましたが、いまや上位モデルの得点が非常に高く、ほぼ飽和しており、最上位システムを見分けにくくなっています。
解説付きの例
課題
以下は高校化学に関する多肢選択問題です。次のうち強酸はどれですか。 A) HF B) HCl C) CH3COOH D) H2CO3
解答
HCl は水中で完全に電離するため強酸であり、HF、CH3COOH、H2CO3 は部分的にしか電離しない(弱酸)。最終解答:B) HCl。
解説
強酸は水溶液中で H+ と共役塩基へ完全に解離し、HCl はこれに該当するが他は該当しない。MMLU は完全一致の正解率で採点し、選んだ選択肢の記号が正解ラベル(B)と一致しなければならない。