Benchmark · multimodal

MMMU

8 परिणाम 7 मॉडल

MMMU (Massive Multi-discipline Multimodal Understanding) यह जाँचता है कि क्या कोई मॉडल कई शैक्षणिक विषयों में छवियों और पाठ को मिलाकर पूछे गए कॉलेज-स्तर के प्रश्नों का उत्तर दे सकता है। परिणाम सही उत्तरों के प्रतिशत (सटीकता) के रूप में दिया जाता है।

और पढ़ें
उदाहरण
किसी प्रश्न में पाठ के साथ रसायन विज्ञान का आरेख, ग्राफ़ या चिकित्सा छवि दी जा सकती है और मॉडल से तर्क करके सही उत्तर चुनने को कहा जाता है — जैसे विश्वविद्यालय की परीक्षा का कोई प्रश्न।
स्कोरिंग
हर प्रश्न को सही या गलत आँका जाता है, और स्कोर सही उत्तर दिए गए प्रश्नों का प्रतिशत (सटीकता) होता है।
सत्यापन
उत्तरों की जाँच संदर्भ उत्तर से exact match द्वारा स्वचालित रूप से की जाती है (ज़्यादातर बहुविकल्पीय, कुछ छोटे खुले उत्तर), इसलिए मानवीय मूल्यांकन की आवश्यकता नहीं होती।
यह क्यों मायने रखता है
यह दर्जनों विषयों में छवियों और पाठ पर विशेषज्ञ, कॉलेज-स्तर के तर्क को मापता है, जिससे यह केवल पाठ की क्षमता के बजाय वास्तविक मल्टीमॉडल समझ की कड़ी परीक्षा बन जाता है।
हल किया गया उदाहरण
कार्य
(छवि: एक परिपथ आरेख — एक ही लूप में 12 V बैटरी के साथ श्रेणी में जुड़े दो प्रतिरोधक, R1 = 4 Ω और R2 = 8 Ω।) प्रतिरोधक R2 से होकर कितनी धारा बहती है? विकल्प: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A।
समाधान
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
व्याख्या
श्रेणी परिपथ में हर अवयव से समान धारा बहती है और कुल प्रतिरोध भागों का योग होता है, इसलिए I = 12/12 = 1.0 A। MMMU इसे अनुमानित विकल्प अक्षर के एकमात्र सही उत्तर से सटीक मिलान द्वारा अंक देता है।
0 22.5 45 67.5 90 2023-11-27 2024-10-01 2025-08-07 Gemini 2.5 Pro · 81.7 · 2025-03-26 Gemini 2.0 Flash · 71.7 · 2025-04-15 o4-mini · 81.6 · 2025-04-17 GPT-5 · 84.2 · 2025-08-07 GPT-5 · 84.2 · 2025-08-07 GPT-4V · 56.8 · 2023-11-27 Claude 3 Opus · 59.4 · 2024-03-04 GPT-4o · 69.1 · 2024-05-13
Gemini 2.5 Pro Gemini 2.0 Flash o4-mini GPT-5 GPT-4V Claude 3 Opus GPT-4o
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2025-08-07 GPT-5 84.2% OpenAI ने एकत्रीकृत रूटिंग और विशेषज्ञ-स्तरीय तर्क के साथ GPT-5 पेश किया
2025-08-07 GPT-5 84.2% ओपनएआई ने अनुकूलित तर्कशक्ति और एकीकृत वास्तुकला के साथ GPT-5 लॉन्च किया
2025-04-17 o4-mini 81.6% OpenAI ने o4-mini जारी किया, जो एक तेज़ और सस्ता बहुआयामी तर्क मॉडल है
2025-04-15 Gemini 2.0 Flash 71.7% गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया
2025-03-26 Gemini 2.5 Pro 81.7% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2024-05-13 GPT-4o 69.1% OpenAI
2024-03-04 Claude 3 Opus 59.4% Anthropic
2023-11-27 GPT-4V 56.8% MMMU paper