Benchmark · multimodal

MMMU

8 hasil 7 model

MMMU (Massive Multi-discipline Multimodal Understanding) menguji apakah sebuah model dapat menjawab soal tingkat perguruan tinggi yang menggabungkan gambar dan teks di berbagai disiplin ilmu. Hasilnya dilaporkan sebagai persentase jawaban benar (akurasi).

Selengkapnya
Contoh
Sebuah soal bisa menampilkan diagram kimia, grafik, atau citra medis bersama teks dan meminta model bernalar lalu memilih jawaban yang benar, seperti soal pada ujian universitas.
Penilaian
Setiap soal dinilai benar atau salah, dan skornya adalah persentase soal yang dijawab dengan benar (akurasi).
Verifikasi
Jawaban diverifikasi secara otomatis melalui kecocokan persis (exact match) dengan jawaban acuan (kebanyakan pilihan ganda, sebagian jawaban terbuka singkat), tanpa penilaian manusia.
Mengapa penting
Ia mengukur penalaran tingkat ahli setara perguruan tinggi atas gambar dan teks di puluhan mata pelajaran, sehingga menjadi uji ketat pemahaman multimodal yang sesungguhnya, bukan sekadar kemampuan teks.
Contoh penyelesaian
Tugas
(Gambar: diagram rangkaian — sebuah baterai 12 V dalam satu loop dengan dua resistor terhubung seri, R1 = 4 Ω dan R2 = 8 Ω.) Berapa arus yang mengalir melalui resistor R2? Pilihan: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A.
Solusi
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
Penjelasan
Pada rangkaian seri, arus yang sama mengalir melalui setiap elemen dan hambatan totalnya adalah jumlah dari bagian-bagiannya, sehingga I = 12/12 = 1.0 A. MMMU menilainya dengan kecocokan persis antara huruf pilihan yang diprediksi dan satu-satunya jawaban benar.
0 22.5 45 67.5 90 2023-11-27 2024-10-01 2025-08-07 Gemini 2.5 Pro · 81.7 · 2025-03-26 Gemini 2.0 Flash · 71.7 · 2025-04-15 o4-mini · 81.6 · 2025-04-17 GPT-5 · 84.2 · 2025-08-07 GPT-5 · 84.2 · 2025-08-07 GPT-4V · 56.8 · 2023-11-27 Claude 3 Opus · 59.4 · 2024-03-04 GPT-4o · 69.1 · 2024-05-13
Gemini 2.5 Pro Gemini 2.0 Flash o4-mini GPT-5 GPT-4V Claude 3 Opus GPT-4o
Linimasa
Tanggal Model Skor Sumber
2025-08-07 GPT-5 84.2% OpenAI memperkenalkan GPT-5 dengan routing terpadu dan penalaran tingkat ahli
2025-08-07 GPT-5 84.2% OpenAI meluncurkan GPT-5 dengan penalaran adaptif dan arsitektur terpadu
2025-04-17 o4-mini 81.6% OpenAI merilis o4-mini, model penalaran multimodal yang lebih cepat dan murah
2025-04-15 Gemini 2.0 Flash 71.7% Google merilis Gemini 2.0 Flash dengan kualitas yang ditingkatkan dan kecepatan dua kali lipat dari Gemini 1.5 Pro
2025-03-26 Gemini 2.5 Pro 81.7% Google merilis model penalaran Gemini 2.5 Pro eksperimental dengan konteks 1M token
2024-05-13 GPT-4o 69.1% OpenAI
2024-03-04 Claude 3 Opus 59.4% Anthropic
2023-11-27 GPT-4V 56.8% MMMU paper