Benchmark · general

MMLU-Pro

12 परिणाम 11 मॉडल

MMLU-Pro, MMLU का एक कठिन और तर्क-केंद्रित उत्तराधिकारी है, जो प्रत्येक प्रश्न में 10 उत्तर विकल्प वाले बहुविकल्पीय प्रश्नों के ज़रिए कई शैक्षणिक विषयों में मॉडल के ज्ञान और समस्या-समाधान की जाँच करता है। परिणाम प्रतिशत सटीकता (accuracy) के रूप में दिया जाता है — यानी सही उत्तर दिए गए प्रश्नों का अनुपात।

और पढ़ें
उदाहरण
एक सामान्य प्रश्न गणित, भौतिकी, कानून या इंजीनियरिंग जैसे किसी क्षेत्र का बहुविकल्पीय प्रश्न होता है जिसमें कई तर्क-चरण लगते हैं, और मॉडल को 10 विकल्पों में से एकमात्र सही उत्तर चुनना होता है (मूल MMLU में केवल 4 विकल्प थे)।
स्कोरिंग
मापदंड सटीकता (accuracy) है: उन प्रश्नों का प्रतिशत जिनमें मॉडल सही विकल्प चुनता है, जिसे सही उत्तरों को कुल प्रश्नों से भाग देकर निकाला जाता है।
सत्यापन
हर उत्तर की जाँच स्वचालित रूप से होती है — मॉडल द्वारा चुने गए विकल्प का ज्ञात सही लेबल से सटीक मिलान (exact match) किया जाता है, इसलिए किसी मानवीय मूल्यांकन की ज़रूरत नहीं होती।
यह क्यों मायने रखता है
चूँकि अग्रणी मॉडल मूल MMLU को लगभग संतृप्त कर चुके थे, MMLU-Pro के कठिन प्रश्न और 10 विकल्प इसे अधिक विभेदक और वास्तविक तर्क के प्रति अधिक संवेदनशील बनाते हैं, जिससे प्रगति का अधिक स्पष्ट संकेत मिलता है।
हल किया गया उदाहरण
कार्य
MMLU-Pro (भौतिकी, 10 विकल्प)। एक प्रक्षेप्य ज़मीन के स्तर से 20 m/s की गति से, क्षैतिज से 30° के कोण पर छोड़ा जाता है (g = 10 m/s², वायु प्रतिरोध नहीं)। इसकी अधिकतम ऊँचाई क्या है? A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
समाधान
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
व्याख्या
उच्चतम बिंदु पर ऊर्ध्वाधर वेग शून्य होता है, इसलिए h_max = v_y²/(2g) जहाँ v_y = v·sin30°; ऊँचाई केवल ऊर्ध्वाधर घटक से तय होती है। MMLU-Pro चुने गए अक्षर का सही उत्तर कुंजी से यथार्थ मिलान करके अंक देता है (इसके 10 विकल्पों पर accuracy)।
0 24 48 72 96 2024-06-03 2025-07-23 2026-09-11 GPT-4o · 72.6 · 2024-06-03 GPT-4o · 72.6 · 2024-06-03 GPT-4-Turbo · 63.7 · 2024-06-03 Claude 3.5 Sonnet · 90.4 · 2024-06-20 Falcon3-10B-Base · 42.5 · 2024-12-17 Falcon3-3B-Instruct · 29.7 · 2024-12-17 Falcon3-7B-Base · 39.2 · 2024-12-17 DeepSeek-V3-0324 · 81.2 · 2025-03-24 Gemini 2.0 Flash · 77.6 · 2025-04-15 Deepseek-R1-0528 · 85 · 2025-05-30 GLM-4.5 · 84.6 · 2025-07-28 Expert LoRA adapters · 75.3 · 2026-09-11
GPT-4o GPT-4-Turbo Claude 3.5 Sonnet Falcon3-10B-Base Falcon3-3B-Instruct Falcon3-7B-Base DeepSeek-V3-0324 Gemini 2.0 Flash Deepseek-R1-0528 GLM-4.5 Expert LoRA adapters
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-11 Expert LoRA adapters 75.3% Together AI ने विशेषज्ञ LoRA, लाइव मेट्रिक्स और कीमतों में कमी के साथ फाइन-ट्यूनिंग का विस्तार किया
2025-07-28 GLM-4.5 84.6% Zhipu AI ने बुद्धिमान एजेंटों के लिए GLM-4.5 और GLM-4.5-Air फाउंडेशन मॉडल जारी किए
2025-05-30 Deepseek-R1-0528 85.0% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-04-15 Gemini 2.0 Flash 77.6% गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया
2025-03-24 DeepSeek-V3-0324 81.2% DeepSeek-V3-0324 ने DeepSeek-V3 की तुलना में तर्कशक्ति, कोडिंग और चीनी लेखन में सुधार किया है
2024-12-17 Falcon3-10B-Base 42.5% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-12-17 Falcon3-3B-Instruct 29.7% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-12-17 Falcon3-7B-Base 39.2% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-06-20 Claude 3.5 Sonnet 90.4% एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया
2024-06-03 GPT-4o 72.6% MMLU-Pro 10 विकल्पों और तर्क-केंद्रित प्रश्नों के साथ एक अधिक मजबूत मानदंड पेश करता है
2024-06-03 GPT-4-Turbo 63.7% MMLU-Pro 10 विकल्पों और तर्क-केंद्रित प्रश्नों के साथ एक अधिक मजबूत मानदंड पेश करता है
2024-06-03 GPT-4o 72.6% MMLU-Pro paper