Benchmark · multimodal
MMMU
MMMU (Massive Multi-discipline Multimodal Understanding) menguji apakah sebuah model dapat menjawab soal tingkat perguruan tinggi yang menggabungkan gambar dan teks di berbagai disiplin ilmu. Hasilnya dilaporkan sebagai persentase jawaban benar (akurasi).
Selengkapnya
- Contoh
- Sebuah soal bisa menampilkan diagram kimia, grafik, atau citra medis bersama teks dan meminta model bernalar lalu memilih jawaban yang benar, seperti soal pada ujian universitas.
- Penilaian
- Setiap soal dinilai benar atau salah, dan skornya adalah persentase soal yang dijawab dengan benar (akurasi).
- Verifikasi
- Jawaban diverifikasi secara otomatis melalui kecocokan persis (exact match) dengan jawaban acuan (kebanyakan pilihan ganda, sebagian jawaban terbuka singkat), tanpa penilaian manusia.
- Mengapa penting
- Ia mengukur penalaran tingkat ahli setara perguruan tinggi atas gambar dan teks di puluhan mata pelajaran, sehingga menjadi uji ketat pemahaman multimodal yang sesungguhnya, bukan sekadar kemampuan teks.
Contoh penyelesaian
Tugas
(Gambar: diagram rangkaian — sebuah baterai 12 V dalam satu loop dengan dua resistor terhubung seri, R1 = 4 Ω dan R2 = 8 Ω.) Berapa arus yang mengalir melalui resistor R2? Pilihan: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
Solusi
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
Penjelasan
Pada rangkaian seri, arus yang sama mengalir melalui setiap elemen dan hambatan totalnya adalah jumlah dari bagian-bagiannya, sehingga I = 12/12 = 1.0 A. MMMU menilainya dengan kecocokan persis antara huruf pilihan yang diprediksi dan satu-satunya jawaban benar.
| Tanggal | Model | Skor | Sumber |
|---|---|---|---|
| 2025-08-07 | GPT-5 | 84.2% | OpenAI memperkenalkan GPT-5 dengan routing terpadu dan penalaran tingkat ahli |
| 2025-08-07 | GPT-5 | 84.2% | OpenAI meluncurkan GPT-5 dengan penalaran adaptif dan arsitektur terpadu |
| 2025-04-17 | o4-mini | 81.6% | OpenAI merilis o4-mini, model penalaran multimodal yang lebih cepat dan murah |
| 2025-04-15 | Gemini 2.0 Flash | 71.7% | Google merilis Gemini 2.0 Flash dengan kualitas yang ditingkatkan dan kecepatan dua kali lipat dari Gemini 1.5 Pro |
| 2025-03-26 | Gemini 2.5 Pro | 81.7% | Google merilis model penalaran Gemini 2.5 Pro eksperimental dengan konteks 1M token |
| 2024-05-13 | GPT-4o | 69.1% | OpenAI |
| 2024-03-04 | Claude 3 Opus | 59.4% | Anthropic |
| 2023-11-27 | GPT-4V | 56.8% | MMMU paper |