Benchmark · multimodal

MMMU-Pro

11 hasil 8 model

MMMU-Pro adalah versi MMMU yang diperkuat ketangguhannya, yang mengukur pemahaman dan penalaran multimodal (gambar + teks) setingkat perguruan tinggi di enam disiplin ilmu; metriknya adalah akurasi pada soal pilihan ganda.

Selengkapnya
Contoh
Sebuah soal dari suatu disiplin memadukan sebuah gambar — diagram, grafik, struktur kimia, atau citra medis — dengan pertanyaan setingkat perguruan tinggi dan hingga 10 pilihan jawaban; pada mode khusus-penglihatan (vision-only), seluruh soal beserta pilihannya disematkan di dalam sebuah tangkapan layar atau foto, sehingga model harus membaca teks langsung dari gambar itu sendiri.
Penilaian
Akurasi: pilihan yang dipilih model dicocokkan secara persis dengan kunci jawaban rujukan, dan skornya adalah persentase soal yang dijawab benar. Pilihan kandidat diperbanyak dari 4 menjadi 10 untuk menekan tebakan acak, dan skor keseluruhan MMMU-Pro adalah rata-rata dari mode Standard (10 pilihan) dan Vision (masukan gambar) (biasanya digunakan penalaran berantai, Chain-of-Thought).
Verifikasi
Setiap soal adalah pilihan ganda dengan satu jawaban benar, sehingga penilaian bersifat otomatis: pilihan akhir yang diambil diekstraksi dari keluaran model (sering kali dengan rantai penalaran) dan dibandingkan secara persis dengan jawaban rujukan. Ketangguhan tertanam dalam datanya — soal yang bisa dijawab oleh model teks-saja disaring keluar dan jumlah pilihan dinaikkan menjadi 10 — sehingga skor tinggi mencerminkan penalaran multimodal yang sejati, bukan jalan pintas berbasis teks atau tebakan yang beruntung.
Mengapa penting
MMMU yang asli menggelembungkan skor karena model bisa memanfaatkan jalan pintas berbasis teks atau menebak di antara empat pilihan; MMMU-Pro menghilangkan keduanya, sehingga akurasi yang terukur turun tajam dan lebih baik memisahkan model yang benar-benar memadukan penglihatan dan teks, menjadikannya ukuran yang lebih jujur atas kemampuan multimodal setingkat pakar.
Contoh penyelesaian
Tugas
Butir soal Sains (Fisika) yang representatif dalam format MMMU-Pro. [Gambar: sebuah balok pada bidang miring tanpa gesekan dengan sudut θ = 30°.] Pertanyaan: berapakah besar percepatan balok sepanjang bidang miring? Pilihan (10): (A) 0 m/s² (B) 1.6 m/s² (C) 2.5 m/s² (D) 3.3 m/s² (E) 4.9 m/s² (F) 5.7 m/s² (G) 6.9 m/s² (H) 7.4 m/s² (I) 8.5 m/s² (J) 9.8 m/s². Pada mode khusus-penglihatan, seluruh pernyataan soal ini muncul tersemat di dalam sebuah tangkapan layar.
Solusi
a = g·sin θ = 9.8 × sin 30° = 9.8 × 0.5 = 4.9 m/s² → (E)
Penjelasan
Pada bidang miring tanpa gesekan, satu-satunya gaya yang bekerja sepanjang permukaan adalah komponen gravitasi mg·sin θ, sehingga percepatannya adalah g·sin θ dan tidak bergantung pada massa balok; g·sin 30° = 4.9 m/s², yang sesuai dengan pilihan (E). Penilaian membandingkan huruf pilihan yang diekstraksi dengan kunci jawaban rujukan secara pencocokan persis.
0 22.5 45 67.5 90 2023-12-06 2025-04-04 2026-08-03 Gemini Ultra · 59.4 · 2023-12-06 Claude 3.5 Sonnet · 68.3 · 2024-06-20 o1 · 78.2 · 2024-09-12 Gemini 2.5 Pro Deep Think · 84 · 2025-05-20 Gemini 3 Pro · 81 · 2025-11-18 Gemini 3 Pro · 81 · 2025-11-18 Claude Opus 4.6 · 73.9 · 2026-02-05 Claude Opus 4.6 · 70.6 · 2026-02-05 Claude Opus 4.6 · 70.6 · 2026-03-06 Kimi K3 · 81.6 · 2026-07-17 Inkling-Small · 74 · 2026-08-03
Gemini Ultra Claude 3.5 Sonnet o1 Gemini 2.5 Pro Deep Think Gemini 3 Pro Claude Opus 4.6 Kimi K3 Inkling-Small
Linimasa
Tanggal Model Skor Sumber
2026-08-03 Inkling-Small 74.0% Thinking Machines Lab merilis Inkling-Small, model MoE multimodal dengan bobot terbuka 276B
2026-07-17 Kimi K3 81.6% Moonshot AI merilis Kimi K3 terbuka, model MoE 2,8T parameter dengan konteks 1M
2026-03-06 Claude Opus 4.6 70.6% Anthropic merilis kartu sistem Claude Opus 4.6 yang merinci kemampuan dan penilaian keamanan
2026-02-05 Claude Opus 4.6 73.9% Anthropic merilis Claude Opus 4.6 dengan jendela konteks 1M dan peningkatan agentic
2026-02-05 Claude Opus 4.6 70.6% Anthropic menerbitkan kartu sistem Claude Opus 4.6 yang merinci kemampuan dan evaluasi keamanan
2025-11-18 Gemini 3 Pro 81.0% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-11-18 Gemini 3 Pro 81.0% Google merilis Gemini 3 Pro dengan kemampuan penalaran dan multimodal terkini
2025-05-20 Gemini 2.5 Pro Deep Think 84.0% Google DeepMind memperbarui Gemini 2.5 dengan Deep Think, output audio, dan penggunaan komputer
2024-09-12 o1 78.2% OpenAI merilis o1-preview, model penalaran yang melampaui pakar manusia pada benchmark matematika dan sains
2024-06-20 Claude 3.5 Sonnet 68.3% Anthropic merilis tambahan untuk Claude 3.5 Sonnet dengan peningkatan benchmark pemrograman dan visi
2023-12-06 Gemini Ultra 59.4% Google memperkenalkan Gemini 1.0, model AI multimodal terbesarnya