Benchmark · general

MMLU

saturated 15 hasil 12 model

MMLU (Massive Multitask Language Understanding) menguji keluasan pengetahuan sebuah model di 57 mata pelajaran—dari sejarah dan hukum hingga matematika dan kedokteran—melalui soal pilihan ganda. Hasilnya dinyatakan sebagai % akurasi: proporsi soal yang dijawab dengan benar.

Selengkapnya
Contoh
Soal umumnya berisi satu pertanyaan dan empat pilihan berlabel (A–D), dan model harus memilih yang benar—misalnya soal kedokteran tingkat universitas atau soal matematika dasar.
Penilaian
Metriknya adalah akurasi (accuracy): persentase soal pilihan ganda yang jawabannya dipilih benar oleh model, dirata-ratakan di seluruh 57 mata pelajaran.
Verifikasi
Penilaian bersifat otomatis dan objektif—huruf yang dipilih model dicocokkan secara persis (exact-match) dengan kunci jawaban yang sudah diketahui, sehingga tidak perlu penilaian manusia.
Mengapa penting
MMLU menjadi tolok ukur standar untuk keluasan pengetahuan dan penalaran, tetapi kini model-model terbaik meraih skor sangat tinggi sehingga tolok ukur ini sebagian besar sudah jenuh dan makin sulit membedakan sistem-sistem terbaik.
Contoh penyelesaian
Tugas
Berikut adalah soal pilihan ganda tentang kimia SMA. Manakah di antara berikut yang merupakan asam kuat? A) HF B) HCl C) CH3COOH D) H2CO3
Solusi
HCl terionisasi sempurna dalam air sehingga merupakan asam kuat; HF, CH3COOH, dan H2CO3 hanya terionisasi sebagian (asam lemah). Jawaban akhir: B) HCl.
Penjelasan
Asam kuat terdisosiasi sepenuhnya menjadi H+ dan basa konjugatnya dalam larutan berair, yang dilakukan HCl tetapi tidak oleh yang lain. MMLU menilainya dengan akurasi kecocokan persis: huruf pilihan yang dipilih harus sama dengan kunci jawaban (B).
0 24 48 72 96 2023-03-14 2024-03-29 2025-04-15 Gemini Ultra · 90 · 2023-12-06 Gemini Ultra · 90 · 2023-12-06 Qwen2-72B · 84.2 · 2024-07-15 Qwen2-72B · 84.2 · 2024-07-15 Mistral Large 2 · 84 · 2024-07-24 Mistral Large 2 · 84 · 2024-07-25 Falcon3-10B-Base · 73.1 · 2024-12-17 Falcon3-7B-Base · 67.4 · 2024-12-17 Claude 3.7 Sonnet · 86.1 · 2025-02-24 GPT‑4.1 nano · 80.1 · 2025-04-14 Gemini 2.0 Flash · 83.4 · 2025-04-15 GPT-3.5 · 70 · 2023-03-14 GPT-4 · 86.4 · 2023-03-14 Claude 2 · 78.5 · 2023-07-11 Claude 3 Opus · 86.8 · 2024-03-04
Gemini Ultra Qwen2-72B Mistral Large 2 Falcon3-10B-Base Falcon3-7B-Base Claude 3.7 Sonnet GPT‑4.1 nano Gemini 2.0 Flash GPT-3.5 GPT-4 Claude 2 Claude 3 Opus
Linimasa
Tanggal Model Skor Sumber
2025-04-15 Gemini 2.0 Flash 83.4% Google merilis Gemini 2.0 Flash dengan kualitas yang ditingkatkan dan kecepatan dua kali lipat dari Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 80.1% OpenAI meluncurkan GPT-4.1, GPT-4.1 mini, dan GPT-4.1 nano di API
2025-02-24 Claude 3.7 Sonnet 86.1% Anthropic merilis Claude 3.7 Sonnet dengan kontrol penalaran dinamis
2024-12-17 Falcon3-10B-Base 73.1% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik
2024-12-17 Falcon3-7B-Base 67.4% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik
2024-07-25 Mistral Large 2 84.0% Mistral merilis Mistral Large 2 dengan konteks 128K dan dukungan multibahasa yang ditingkatkan
2024-07-24 Mistral Large 2 84.0% Mistral merilis Large 2 dengan 123B parameter untuk inferensi single-node yang hemat biaya
2024-07-15 Qwen2-72B 84.2% Tim Qwen merilis seri Qwen2 dengan model padat dan MoE 72B
2024-07-15 Qwen2-72B 84.2% Laporan Teknis Qwen2 memperkenalkan model padat dan MoE hingga 72B
2024-03-04 Claude 3 Opus 86.8% Anthropic
2023-12-06 Gemini Ultra 90.0% Google memperkenalkan Gemini 1.0, model AI multimodal terbesarnya
2023-12-06 Gemini Ultra 90.0% Google
2023-07-11 Claude 2 78.5% Anthropic
2023-03-14 GPT-3.5 70.0% OpenAI
2023-03-14 GPT-4 86.4% OpenAI