Benchmark · general

MMLU

saturated 15 परिणाम 12 मॉडल

MMLU (Massive Multitask Language Understanding) बहुविकल्पीय प्रश्नों के ज़रिए किसी मॉडल के ज्ञान की व्यापकता को 57 विषयों में परखता है—इतिहास और कानून से लेकर गणित और चिकित्सा तक। परिणाम % सटीकता (accuracy) के रूप में दिया जाता है, यानी सही उत्तर वाले प्रश्नों का अनुपात।

और पढ़ें
उदाहरण
एक सामान्य प्रश्न में एक सवाल और चार अंकित विकल्प (A–D) होते हैं, और मॉडल को सही विकल्प चुनना होता है—जैसे कॉलेज-स्तर का चिकित्सा का सवाल या प्राथमिक गणित की समस्या।
स्कोरिंग
मापक है सटीकता (accuracy): उन बहुविकल्पीय प्रश्नों का प्रतिशत जिनमें मॉडल सही विकल्प चुनता है, सभी 57 विषयों पर औसत निकालकर।
सत्यापन
जाँच स्वचालित और वस्तुनिष्ठ है—मॉडल द्वारा चुने गए अक्षर का ज्ञात सही उत्तर से सटीक मिलान (exact-match) किया जाता है, इसलिए किसी मानवीय निर्णय की ज़रूरत नहीं होती।
यह क्यों मायने रखता है
MMLU सामान्य ज्ञान और तर्क की व्यापकता मापने का एक मानक पैमाना बन गया, पर अब शीर्ष मॉडल इतने ऊँचे अंक पाते हैं कि यह काफ़ी हद तक संतृप्त हो चुका है और सर्वश्रेष्ठ सिस्टमों में अंतर करना कठिन हो गया है।
हल किया गया उदाहरण
कार्य
नीचे हाई स्कूल रसायन विज्ञान पर एक बहुविकल्पीय प्रश्न दिया गया है। इनमें से कौन-सा एक प्रबल अम्ल है? A) HF B) HCl C) CH3COOH D) H2CO3
समाधान
HCl जल में पूरी तरह आयनित होता है, इसलिए यह प्रबल अम्ल है; HF, CH3COOH और H2CO3 केवल आंशिक रूप से आयनित होते हैं (दुर्बल अम्ल)। अंतिम उत्तर: B) HCl।
व्याख्या
प्रबल अम्ल जलीय विलयन में पूर्णतः H+ और अपने संयुग्मी क्षार में वियोजित हो जाता है, जो HCl करता है पर अन्य नहीं। MMLU इसे सटीक-मिलान शुद्धता से आँकता है: चुने गए विकल्प का अक्षर सही उत्तर (B) से मेल खाना चाहिए।
0 24 48 72 96 2023-03-14 2024-03-29 2025-04-15 Gemini Ultra · 90 · 2023-12-06 Gemini Ultra · 90 · 2023-12-06 Qwen2-72B · 84.2 · 2024-07-15 Qwen2-72B · 84.2 · 2024-07-15 Mistral Large 2 · 84 · 2024-07-24 Mistral Large 2 · 84 · 2024-07-25 Falcon3-10B-Base · 73.1 · 2024-12-17 Falcon3-7B-Base · 67.4 · 2024-12-17 Claude 3.7 Sonnet · 86.1 · 2025-02-24 GPT‑4.1 nano · 80.1 · 2025-04-14 Gemini 2.0 Flash · 83.4 · 2025-04-15 GPT-3.5 · 70 · 2023-03-14 GPT-4 · 86.4 · 2023-03-14 Claude 2 · 78.5 · 2023-07-11 Claude 3 Opus · 86.8 · 2024-03-04
Gemini Ultra Qwen2-72B Mistral Large 2 Falcon3-10B-Base Falcon3-7B-Base Claude 3.7 Sonnet GPT‑4.1 nano Gemini 2.0 Flash GPT-3.5 GPT-4 Claude 2 Claude 3 Opus
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2025-04-15 Gemini 2.0 Flash 83.4% गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया
2025-04-14 GPT‑4.1 nano 80.1% OpenAI ने API में GPT-4.1, GPT-4.1 mini और GPT-4.1 nano लॉन्च किए
2025-02-24 Claude 3.7 Sonnet 86.1% Anthropic ने Claude 3.7 Sonnet को गतिशील तर्क नियंत्रण के साथ जारी किया
2024-12-17 Falcon3-10B-Base 73.1% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-12-17 Falcon3-7B-Base 67.4% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-07-25 Mistral Large 2 84.0% मिस्ट्रल ने 128K संदर्भ और सुधारी गई बहुभाषी सहायता के साथ मिस्ट्रल लार्ज 2 जारी किया
2024-07-24 Mistral Large 2 84.0% Mistral ने लागत-कुशल सिंगल-नोड इनफरेंस के लिए 123B पैरामीटर वाले Large 2 को जारी किया
2024-07-15 Qwen2-72B 84.2% Qwen टीम ने 72B डेंस और MoE मॉडल के साथ Qwen2 सीरीज जारी की
2024-07-15 Qwen2-72B 84.2% Qwen2 तकनीकी रिपोर्ट में 72B तक घन और MoE मॉडल पेश किए गए
2024-03-04 Claude 3 Opus 86.8% Anthropic
2023-12-06 Gemini Ultra 90.0% Google ने Gemini 1.0 पेश किया, उसका सबसे बड़ा मल्टीमोडल AI मॉडल
2023-12-06 Gemini Ultra 90.0% Google
2023-07-11 Claude 2 78.5% Anthropic
2023-03-14 GPT-3.5 70.0% OpenAI
2023-03-14 GPT-4 86.4% OpenAI