Benchmark · general

MMLU-Pro

11 परिणाम 10 मॉडल

MMLU-Pro, MMLU का एक कठिन और तर्क-केंद्रित उत्तराधिकारी है, जो प्रत्येक प्रश्न में 10 उत्तर विकल्प वाले बहुविकल्पीय प्रश्नों के ज़रिए कई शैक्षणिक विषयों में मॉडल के ज्ञान और समस्या-समाधान की जाँच करता है। परिणाम प्रतिशत सटीकता (accuracy) के रूप में दिया जाता है — यानी सही उत्तर दिए गए प्रश्नों का अनुपात।

और पढ़ें
उदाहरण
एक सामान्य प्रश्न गणित, भौतिकी, कानून या इंजीनियरिंग जैसे किसी क्षेत्र का बहुविकल्पीय प्रश्न होता है जिसमें कई तर्क-चरण लगते हैं, और मॉडल को 10 विकल्पों में से एकमात्र सही उत्तर चुनना होता है (मूल MMLU में केवल 4 विकल्प थे)।
स्कोरिंग
मापदंड सटीकता (accuracy) है: उन प्रश्नों का प्रतिशत जिनमें मॉडल सही विकल्प चुनता है, जिसे सही उत्तरों को कुल प्रश्नों से भाग देकर निकाला जाता है।
सत्यापन
हर उत्तर की जाँच स्वचालित रूप से होती है — मॉडल द्वारा चुने गए विकल्प का ज्ञात सही लेबल से सटीक मिलान (exact match) किया जाता है, इसलिए किसी मानवीय मूल्यांकन की ज़रूरत नहीं होती।
यह क्यों मायने रखता है
चूँकि अग्रणी मॉडल मूल MMLU को लगभग संतृप्त कर चुके थे, MMLU-Pro के कठिन प्रश्न और 10 विकल्प इसे अधिक विभेदक और वास्तविक तर्क के प्रति अधिक संवेदनशील बनाते हैं, जिससे प्रगति का अधिक स्पष्ट संकेत मिलता है।
हल किया गया उदाहरण
कार्य
MMLU-Pro (भौतिकी, 10 विकल्प)। एक प्रक्षेप्य ज़मीन के स्तर से 20 m/s की गति से, क्षैतिज से 30° के कोण पर छोड़ा जाता है (g = 10 m/s², वायु प्रतिरोध नहीं)। इसकी अधिकतम ऊँचाई क्या है? A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
समाधान
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
व्याख्या
उच्चतम बिंदु पर ऊर्ध्वाधर वेग शून्य होता है, इसलिए h_max = v_y²/(2g) जहाँ v_y = v·sin30°; ऊँचाई केवल ऊर्ध्वाधर घटक से तय होती है। MMLU-Pro चुने गए अक्षर का सही उत्तर कुंजी से यथार्थ मिलान करके अंक देता है (इसके 10 विकल्पों पर accuracy)।
0 24 48 72 96 2024-06-03 2024-12-30 2025-07-28 GPT-4o · 72.6 · 2024-06-03 GPT-4o · 72.6 · 2024-06-03 GPT-4-Turbo · 63.7 · 2024-06-03 Claude 3.5 Sonnet · 90.4 · 2024-06-20 Falcon3-3B-Instruct · 29.7 · 2024-12-17 Falcon3-7B-Base · 39.2 · 2024-12-17 Falcon3-10B-Base · 42.5 · 2024-12-17 DeepSeek-V3-0324 · 81.2 · 2025-03-24 Gemini 2.0 Flash · 77.6 · 2025-04-15 Deepseek-R1-0528 · 85 · 2025-05-30 GLM-4.5 · 84.6 · 2025-07-28
GPT-4o GPT-4-Turbo Claude 3.5 Sonnet Falcon3-3B-Instruct Falcon3-7B-Base Falcon3-10B-Base DeepSeek-V3-0324 Gemini 2.0 Flash Deepseek-R1-0528 GLM-4.5
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2025-07-28 GLM-4.5 84.6% Zhipu AI ने बुद्धिमान एजेंटों के लिए GLM-4.5 और GLM-4.5-Air फाउंडेशन मॉडल जारी किए
2025-05-30 Deepseek-R1-0528 85.0% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-04-15 Gemini 2.0 Flash 77.6% गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया
2025-03-24 DeepSeek-V3-0324 81.2% DeepSeek-V3-0324 ने DeepSeek-V3 की तुलना में तर्कशक्ति, कोडिंग और चीनी लेखन में सुधार किया है
2024-12-17 Falcon3-3B-Instruct 29.7% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-12-17 Falcon3-7B-Base 39.2% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-12-17 Falcon3-10B-Base 42.5% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-06-20 Claude 3.5 Sonnet 90.4% एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया
2024-06-03 GPT-4o 72.6% MMLU-Pro 10 विकल्पों और तर्क-केंद्रित प्रश्नों के साथ एक अधिक मजबूत मानदंड पेश करता है
2024-06-03 GPT-4-Turbo 63.7% MMLU-Pro 10 विकल्पों और तर्क-केंद्रित प्रश्नों के साथ एक अधिक मजबूत मानदंड पेश करता है
2024-06-03 GPT-4o 72.6% MMLU-Pro paper