Benchmark · general

MMLU-Pro

11 hasil 10 model

MMLU-Pro adalah penerus MMLU yang lebih sulit dan berfokus pada penalaran, yang menguji pengetahuan dan kemampuan pemecahan masalah sebuah model di banyak disiplin akademik melalui soal pilihan ganda dengan 10 opsi jawaban per soal. Hasilnya dilaporkan sebagai persentase akurasi — yaitu proporsi soal yang dijawab dengan benar.

Selengkapnya
Contoh
Contoh soal yang khas adalah pertanyaan pilihan ganda dari bidang seperti matematika, fisika, hukum, atau teknik yang memerlukan beberapa langkah penalaran, di mana model harus memilih satu-satunya jawaban benar dari 10 opsi (dibandingkan 4 pada MMLU asli).
Penilaian
Metriknya adalah akurasi (accuracy): persentase soal yang jawabannya dipilih dengan benar oleh model, dihitung sebagai jumlah jawaban benar dibagi total soal.
Verifikasi
Setiap jawaban dinilai secara otomatis dengan mencocokkan secara persis (exact match) opsi yang dipilih model dengan label benar yang telah diketahui, sehingga tidak perlu penilaian manusia.
Mengapa penting
Karena model-model terdepan hampir menjenuhkan MMLU asli, soal yang lebih sulit dan 10 opsi pada MMLU-Pro membuatnya lebih membedakan dan lebih peka terhadap penalaran nyata, sehingga memberikan ukuran kemajuan yang lebih jernih.
Contoh penyelesaian
Tugas
MMLU-Pro (fisika, 10 pilihan). Sebuah proyektil diluncurkan dari permukaan tanah dengan kecepatan 20 m/s pada sudut 30° di atas horizontal (g = 10 m/s², tanpa hambatan udara). Berapa ketinggian maksimumnya? A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
Solusi
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
Penjelasan
Di titik tertinggi kecepatan vertikal nol, sehingga h_max = v_y²/(2g) dengan v_y = v·sin30°; hanya komponen vertikal yang menentukan ketinggian. MMLU-Pro menilai dengan pencocokan persis huruf yang dipilih terhadap kunci jawaban (accuracy atas 10 pilihannya).
0 24 48 72 96 2024-06-03 2024-12-30 2025-07-28 GPT-4o · 72.6 · 2024-06-03 GPT-4o · 72.6 · 2024-06-03 GPT-4-Turbo · 63.7 · 2024-06-03 Claude 3.5 Sonnet · 90.4 · 2024-06-20 Falcon3-3B-Instruct · 29.7 · 2024-12-17 Falcon3-7B-Base · 39.2 · 2024-12-17 Falcon3-10B-Base · 42.5 · 2024-12-17 DeepSeek-V3-0324 · 81.2 · 2025-03-24 Gemini 2.0 Flash · 77.6 · 2025-04-15 Deepseek-R1-0528 · 85 · 2025-05-30 GLM-4.5 · 84.6 · 2025-07-28
GPT-4o GPT-4-Turbo Claude 3.5 Sonnet Falcon3-3B-Instruct Falcon3-7B-Base Falcon3-10B-Base DeepSeek-V3-0324 Gemini 2.0 Flash Deepseek-R1-0528 GLM-4.5
Linimasa
Tanggal Model Skor Sumber
2025-07-28 GLM-4.5 84.6% Zhipu AI merilis model dasar GLM-4.5 dan GLM-4.5-Air untuk agen cerdas
2025-05-30 Deepseek-R1-0528 85.0% DeepSeek memperbarui model R1 dengan penalaran dan skor benchmark yang lebih baik
2025-04-15 Gemini 2.0 Flash 77.6% Google merilis Gemini 2.0 Flash dengan kualitas yang ditingkatkan dan kecepatan dua kali lipat dari Gemini 1.5 Pro
2025-03-24 DeepSeek-V3-0324 81.2% DeepSeek-V3-0324 meningkatkan kemampuan penalaran, pemrograman, dan penulisan bahasa Mandarin dibandingkan DeepSeek-V3
2024-12-17 Falcon3-3B-Instruct 29.7% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik
2024-12-17 Falcon3-7B-Base 39.2% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik
2024-12-17 Falcon3-10B-Base 42.5% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik
2024-06-20 Claude 3.5 Sonnet 90.4% Anthropic merilis tambahan untuk Claude 3.5 Sonnet dengan peningkatan benchmark pemrograman dan visi
2024-06-03 GPT-4o 72.6% MMLU-Pro memperkenalkan benchmark yang lebih robust dengan 10 opsi dan pertanyaan berfokus pada penalaran
2024-06-03 GPT-4-Turbo 63.7% MMLU-Pro memperkenalkan benchmark yang lebih robust dengan 10 opsi dan pertanyaan berfokus pada penalaran
2024-06-03 GPT-4o 72.6% MMLU-Pro paper