Benchmark · multimodal
MMMU
MMMU (Massive Multi-discipline Multimodal Understanding) यह जाँचता है कि क्या कोई मॉडल कई शैक्षणिक विषयों में छवियों और पाठ को मिलाकर पूछे गए कॉलेज-स्तर के प्रश्नों का उत्तर दे सकता है। परिणाम सही उत्तरों के प्रतिशत (सटीकता) के रूप में दिया जाता है।
और पढ़ें
- उदाहरण
- किसी प्रश्न में पाठ के साथ रसायन विज्ञान का आरेख, ग्राफ़ या चिकित्सा छवि दी जा सकती है और मॉडल से तर्क करके सही उत्तर चुनने को कहा जाता है — जैसे विश्वविद्यालय की परीक्षा का कोई प्रश्न।
- स्कोरिंग
- हर प्रश्न को सही या गलत आँका जाता है, और स्कोर सही उत्तर दिए गए प्रश्नों का प्रतिशत (सटीकता) होता है।
- सत्यापन
- उत्तरों की जाँच संदर्भ उत्तर से exact match द्वारा स्वचालित रूप से की जाती है (ज़्यादातर बहुविकल्पीय, कुछ छोटे खुले उत्तर), इसलिए मानवीय मूल्यांकन की आवश्यकता नहीं होती।
- यह क्यों मायने रखता है
- यह दर्जनों विषयों में छवियों और पाठ पर विशेषज्ञ, कॉलेज-स्तर के तर्क को मापता है, जिससे यह केवल पाठ की क्षमता के बजाय वास्तविक मल्टीमॉडल समझ की कड़ी परीक्षा बन जाता है।
हल किया गया उदाहरण
कार्य
(छवि: एक परिपथ आरेख — एक ही लूप में 12 V बैटरी के साथ श्रेणी में जुड़े दो प्रतिरोधक, R1 = 4 Ω और R2 = 8 Ω।) प्रतिरोधक R2 से होकर कितनी धारा बहती है? विकल्प: (A) 1.0 A (B) 1.5 A (C) 2.0 A (D) 3.0 A।
समाधान
R_total = R1 + R2 = 4 Ω + 8 Ω = 12 Ω; I = V / R_total = 12 V / 12 Ω = 1.0 A (series ⇒ same current in R2). Answer: (A).
व्याख्या
श्रेणी परिपथ में हर अवयव से समान धारा बहती है और कुल प्रतिरोध भागों का योग होता है, इसलिए I = 12/12 = 1.0 A। MMMU इसे अनुमानित विकल्प अक्षर के एकमात्र सही उत्तर से सटीक मिलान द्वारा अंक देता है।
| तारीख़ | मॉडल | स्कोर | स्रोत |
|---|---|---|---|
| 2025-08-07 | GPT-5 | 84.2% | OpenAI ने एकत्रीकृत रूटिंग और विशेषज्ञ-स्तरीय तर्क के साथ GPT-5 पेश किया |
| 2025-08-07 | GPT-5 | 84.2% | ओपनएआई ने अनुकूलित तर्कशक्ति और एकीकृत वास्तुकला के साथ GPT-5 लॉन्च किया |
| 2025-04-17 | o4-mini | 81.6% | OpenAI ने o4-mini जारी किया, जो एक तेज़ और सस्ता बहुआयामी तर्क मॉडल है |
| 2025-04-15 | Gemini 2.0 Flash | 71.7% | गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया |
| 2025-03-26 | Gemini 2.5 Pro | 81.7% | गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया |
| 2024-05-13 | GPT-4o | 69.1% | OpenAI |
| 2024-03-04 | Claude 3 Opus | 59.4% | Anthropic |
| 2023-11-27 | GPT-4V | 56.8% | MMMU paper |