Benchmark · multimodal

MMMU-Pro

11 परिणाम 8 मॉडल

MMMU-Pro, MMMU बेंचमार्क का मज़बूती-वर्धित संस्करण है, जो छह विषय-क्षेत्रों में कॉलेज-स्तर की बहुविध (मल्टीमॉडल: छवि + पाठ) समझ और तर्क को मापता है; इसका मापदंड बहुविकल्पीय प्रश्नों की सटीकता (accuracy) है।

और पढ़ें
उदाहरण
किसी विषय का एक प्रश्न एक छवि — आरेख, चार्ट, रासायनिक संरचना या चिकित्सा स्कैन — को कॉलेज-स्तर के प्रश्न और अधिकतम 10 उत्तर-विकल्पों के साथ जोड़ता है; केवल-दृष्टि (vision-only) सेटिंग में पूरा प्रश्न और उसके विकल्प एक स्क्रीनशॉट या फ़ोटो के भीतर अंतर्निहित होते हैं, इसलिए मॉडल को पाठ स्वयं छवि से पढ़ना पड़ता है।
स्कोरिंग
सटीकता (accuracy): मॉडल द्वारा चुने गए विकल्प का संदर्भ उत्तर-कुंजी से सटीक मिलान किया जाता है, और स्कोर सही उत्तर वाले प्रश्नों का प्रतिशत होता है। यादृच्छिक अनुमान को कठिन बनाने के लिए उम्मीदवार विकल्प 4 से बढ़ाकर 10 कर दिए जाते हैं, और समग्र MMMU-Pro स्कोर, Standard (10 विकल्प) और Vision (छवि-इनपुट) सेटिंग्स का औसत होता है (सामान्यतः Chain-of-Thought तर्क-प्रॉम्प्ट का उपयोग होता है)।
सत्यापन
हर प्रश्न एकल-सही-उत्तर वाला बहुविकल्पीय है, इसलिए मूल्यांकन स्वचालित है: अंतिम चुना गया विकल्प मॉडल के आउटपुट (अक्सर विचार-शृंखला सहित) से निकाला जाता है और संदर्भ उत्तर से सटीक मिलान के लिए तुलना की जाती है। मज़बूती डेटा में ही अंतर्निहित है — जिन प्रश्नों का उत्तर केवल-पाठ मॉडल दे सकते हैं उन्हें छाँटकर हटा दिया जाता है और विकल्पों की संख्या 10 तक बढ़ा दी जाती है — इसलिए उच्च स्कोर वास्तविक बहुविध तर्क को दर्शाता है, न कि पाठ-आधारित शॉर्टकट या भाग्यवश लगे अनुमान को।
यह क्यों मायने रखता है
मूल MMMU में स्कोर बढ़े-चढ़े दिखते थे क्योंकि मॉडल केवल-पाठ शॉर्टकट का लाभ उठा सकते थे या चार विकल्पों में से अनुमान लगा सकते थे; MMMU-Pro दोनों को हटा देता है, जिससे मापी गई सटीकता तेज़ी से गिरती है और उन मॉडलों को बेहतर ढंग से अलग करती है जो वास्तव में दृष्टि और पाठ को एकीकृत करते हैं — यह विशेषज्ञ-स्तर की बहुविध क्षमता का अधिक ईमानदार मापन बन जाता है।
हल किया गया उदाहरण
कार्य
MMMU-Pro प्रारूप में विज्ञान (भौतिकी) का एक प्रतिनिधि प्रश्न। [छवि: θ = 30° कोण वाले घर्षण-रहित आनत तल पर रखा एक गुटका।] प्रश्न: आनत तल के अनुदिश गुटके के त्वरण का परिमाण क्या है? विकल्प (10): (A) 0 m/s² (B) 1.6 m/s² (C) 2.5 m/s² (D) 3.3 m/s² (E) 4.9 m/s² (F) 5.7 m/s² (G) 6.9 m/s² (H) 7.4 m/s² (I) 8.5 m/s² (J) 9.8 m/s²। केवल-दृष्टि सेटिंग में यह पूरा प्रश्न एक स्क्रीनशॉट के भीतर अंतर्निहित रूप में दिखाई देता है।
समाधान
a = g·sin θ = 9.8 × sin 30° = 9.8 × 0.5 = 4.9 m/s² → (E)
व्याख्या
घर्षण-रहित आनत तल पर सतह के अनुदिश एकमात्र बल गुरुत्व का घटक mg·sin θ है, इसलिए त्वरण g·sin θ होता है और गुटके के द्रव्यमान से स्वतंत्र होता है; g·sin 30° = 4.9 m/s², जो विकल्प (E) से मेल खाता है। मूल्यांकन निकाले गए विकल्प-अक्षर की संदर्भ उत्तर-कुंजी से सटीक मिलान के आधार पर तुलना करता है।
0 22.5 45 67.5 90 2023-12-06 2025-04-04 2026-08-03 Gemini Ultra · 59.4 · 2023-12-06 Claude 3.5 Sonnet · 68.3 · 2024-06-20 o1 · 78.2 · 2024-09-12 Gemini 2.5 Pro Deep Think · 84 · 2025-05-20 Gemini 3 Pro · 81 · 2025-11-18 Gemini 3 Pro · 81 · 2025-11-18 Claude Opus 4.6 · 73.9 · 2026-02-05 Claude Opus 4.6 · 70.6 · 2026-02-05 Claude Opus 4.6 · 70.6 · 2026-03-06 Kimi K3 · 81.6 · 2026-07-17 Inkling-Small · 74 · 2026-08-03
Gemini Ultra Claude 3.5 Sonnet o1 Gemini 2.5 Pro Deep Think Gemini 3 Pro Claude Opus 4.6 Kimi K3 Inkling-Small
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-03 Inkling-Small 74.0% थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
2026-07-17 Kimi K3 81.6% Moonshot AI ने 1M संदर्भ के साथ 2.8T-पैरामीटर MoE मॉडल Kimi K3 को ओपन किया
2026-03-06 Claude Opus 4.6 70.6% Anthropic ने क्लॉडियस ओपस 4.6 के लिए सिस्टम कार्ड जारी किया, जिसमें क्षमताओं और सुरक्षा मूल्यांकन का विवरण है
2026-02-05 Claude Opus 4.6 73.9% Anthropic ने Claude Opus 4.6 जारी की, जिसमें 1M संदर्भ खिड़की और एजेंटिक सुधार शामिल हैं
2026-02-05 Claude Opus 4.6 70.6% Anthropic ने Claude Opus 4.6 सिस्टम कार्ड प्रकाशित किया जिसमें क्षमताओं और सुरक्षा मूल्यांकन का विवरण है
2025-11-18 Gemini 3 Pro 81.0% Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया
2025-11-18 Gemini 3 Pro 81.0% Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया
2025-05-20 Gemini 2.5 Pro Deep Think 84.0% Google DeepMind ने Deep Think, ऑडियो आउटपुट और कंप्यूटर उपयोग के साथ Gemini 2.5 को अपडेट किया
2024-09-12 o1 78.2% OpenAI ने गणित और विज्ञान मानकों पर मानवीय विशेषज्ञों को पार करने वाले एक तर्क मॉडल o1-preview को जारी किया
2024-06-20 Claude 3.5 Sonnet 68.3% एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया
2023-12-06 Gemini Ultra 59.4% Google ने Gemini 1.0 पेश किया, उसका सबसे बड़ा मल्टीमोडल AI मॉडल