Benchmark · general
MMLU
MMLU (Massive Multitask Language Understanding) menguji keluasan pengetahuan sebuah model di 57 mata pelajaran—dari sejarah dan hukum hingga matematika dan kedokteran—melalui soal pilihan ganda. Hasilnya dinyatakan sebagai % akurasi: proporsi soal yang dijawab dengan benar.
Selengkapnya
- Contoh
- Soal umumnya berisi satu pertanyaan dan empat pilihan berlabel (A–D), dan model harus memilih yang benar—misalnya soal kedokteran tingkat universitas atau soal matematika dasar.
- Penilaian
- Metriknya adalah akurasi (accuracy): persentase soal pilihan ganda yang jawabannya dipilih benar oleh model, dirata-ratakan di seluruh 57 mata pelajaran.
- Verifikasi
- Penilaian bersifat otomatis dan objektif—huruf yang dipilih model dicocokkan secara persis (exact-match) dengan kunci jawaban yang sudah diketahui, sehingga tidak perlu penilaian manusia.
- Mengapa penting
- MMLU menjadi tolok ukur standar untuk keluasan pengetahuan dan penalaran, tetapi kini model-model terbaik meraih skor sangat tinggi sehingga tolok ukur ini sebagian besar sudah jenuh dan makin sulit membedakan sistem-sistem terbaik.
Contoh penyelesaian
Tugas
Berikut adalah soal pilihan ganda tentang kimia SMA. Manakah di antara berikut yang merupakan asam kuat? A) HF B) HCl C) CH3COOH D) H2CO3
Solusi
HCl terionisasi sempurna dalam air sehingga merupakan asam kuat; HF, CH3COOH, dan H2CO3 hanya terionisasi sebagian (asam lemah). Jawaban akhir: B) HCl.
Penjelasan
Asam kuat terdisosiasi sepenuhnya menjadi H+ dan basa konjugatnya dalam larutan berair, yang dilakukan HCl tetapi tidak oleh yang lain. MMLU menilainya dengan akurasi kecocokan persis: huruf pilihan yang dipilih harus sama dengan kunci jawaban (B).