Benchmark · general
MMLU
MMLU (Massive Multitask Language Understanding) बहुविकल्पीय प्रश्नों के ज़रिए किसी मॉडल के ज्ञान की व्यापकता को 57 विषयों में परखता है—इतिहास और कानून से लेकर गणित और चिकित्सा तक। परिणाम % सटीकता (accuracy) के रूप में दिया जाता है, यानी सही उत्तर वाले प्रश्नों का अनुपात।
और पढ़ें
- उदाहरण
- एक सामान्य प्रश्न में एक सवाल और चार अंकित विकल्प (A–D) होते हैं, और मॉडल को सही विकल्प चुनना होता है—जैसे कॉलेज-स्तर का चिकित्सा का सवाल या प्राथमिक गणित की समस्या।
- स्कोरिंग
- मापक है सटीकता (accuracy): उन बहुविकल्पीय प्रश्नों का प्रतिशत जिनमें मॉडल सही विकल्प चुनता है, सभी 57 विषयों पर औसत निकालकर।
- सत्यापन
- जाँच स्वचालित और वस्तुनिष्ठ है—मॉडल द्वारा चुने गए अक्षर का ज्ञात सही उत्तर से सटीक मिलान (exact-match) किया जाता है, इसलिए किसी मानवीय निर्णय की ज़रूरत नहीं होती।
- यह क्यों मायने रखता है
- MMLU सामान्य ज्ञान और तर्क की व्यापकता मापने का एक मानक पैमाना बन गया, पर अब शीर्ष मॉडल इतने ऊँचे अंक पाते हैं कि यह काफ़ी हद तक संतृप्त हो चुका है और सर्वश्रेष्ठ सिस्टमों में अंतर करना कठिन हो गया है।
हल किया गया उदाहरण
कार्य
नीचे हाई स्कूल रसायन विज्ञान पर एक बहुविकल्पीय प्रश्न दिया गया है। इनमें से कौन-सा एक प्रबल अम्ल है? A) HF B) HCl C) CH3COOH D) H2CO3
समाधान
HCl जल में पूरी तरह आयनित होता है, इसलिए यह प्रबल अम्ल है; HF, CH3COOH और H2CO3 केवल आंशिक रूप से आयनित होते हैं (दुर्बल अम्ल)। अंतिम उत्तर: B) HCl।
व्याख्या
प्रबल अम्ल जलीय विलयन में पूर्णतः H+ और अपने संयुग्मी क्षार में वियोजित हो जाता है, जो HCl करता है पर अन्य नहीं। MMLU इसे सटीक-मिलान शुद्धता से आँकता है: चुने गए विकल्प का अक्षर सही उत्तर (B) से मेल खाना चाहिए।