शोधकर्ताओं ने MMLU-Pro का परिचय दिया, जो Massive Multitask Language Understanding मानदंड का एक उन्नत संस्करण है, जिसे वर्तमान बड़े भाषा मॉडलों में प्रदर्शन संतृप्ति और अस्थिरता को दूर करने के लिए डिज़ाइन किया गया है। नया डेटासेट विकल्पों की संख्या को चार से बढ़ाकर दस कर देता है, चुनौतीपूर्ण कॉलेज-स्तर के तर्क प्रश्नों को एकीकृत करता है, और विशेषज्ञ समीक्षा के माध्यम से शोर वाले आइटमों को हटा देता है।
- MMLU की तुलना में सटीकता 16% से घटकर 33% हो गई है, जिसमें शीर्ष मॉडल GPT-4o केवल 72.6% स्कोर करता है।
- प्रॉम्प्ट परिवर्तनों के प्रति मॉडल स्कोर संवेदनशीलता MMLU में 4-5% से घटकर MMLU-Pro में 24 शैलियों में केवल 2% रह गई है।
- Chain of Thought तर्क ने MMLU-Pro पर प्रदर्शन को काफी बढ़ाया है, जिसने GPT-4o को 19% सुधारा है, जबकि यह मूल मानदंड पर परिणामों को खराब करता है।
- इस मानदंड में 14 क्षेत्रों और 12,000 से अधिक प्रश्नों का विस्तार है, जो GPT-4o और GPT-4-Turbo जैसे मॉडलों के बीच अधिक भेद करने की क्षमता प्रदान करता है।
MMLU-Pro विशेषज्ञ-स्तर की भाषा समझ और तर्क क्षमताओं में प्रगति को ट्रैक करने के लिए एक अधिक विश्वसनीय और कठिन मापदंड के रूप में कार्य करता है।