Muse-Ltd ने Hugging Face Evaluation Hub में UncertaintyGym सबमिट किया है, जो एक नया बेंचमार्क है जिसे बड़े भाषा मॉडल (LLM) की मेटा-संज्ञानात्मक कैलिब्रेशन और हॉल्युसिनेशन के बजाय अनिश्चितता व्यक्त करने की उनकी क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

बेंचमार्क क्वेरीज़ को चार अलग-अलग प्रकारों में वर्गीकृत करता है: हल करने योग्य तथ्यात्मक प्रश्न, अधिनिर्धारित क्वेरीज जिन्हें विस्पष्टता दूर करने की आवश्यकता है, झूठी पूर्वधारणा वाले प्रश्न जिन्हें अस्वीकार करने की आवश्यकता है, और स्वाभाविक रूप से अज्ञेय विषय। यह प्राथमिक मेट्रिक्स के रूप में मेटा कॉग्निटिव कैलिब्रेशन स्कोर (MCS) और अनअंसरेबल हॉल्युसिनेशन रेट का उपयोग करता है, जिसमें प्रारंभिक बेलाइन LiquidAI's LFM2.5-2.6B मॉडल द्वारा 45.0% MCS हासिल करने दिखाते हैं।

यह सबमिशन अज्ञेयता को स्पष्ट रूप से घोषित करके, अनुपस्थित संदर्भ या असंभव पूर्वधारणाओं को मॉडल कितनी अच्छी तरह संभालते हैं, इसका मूल्यांकन करने के लिए एक मानकीकृत विधि प्रदान करने का उद्देश्य रखता है।