शोधकर्ताओं ने BenchMIRT पेश किया, जो बहुआयामी आइटम रिस्पॉन्स थ्योरी (Item Response Theory) का उपयोग करके व्यक्तिगत प्रॉम्प्ट स्तर पर बड़े भाषा मॉडल बेंचमार्क्स की ऑडिट करने की एक विधि है। 100 मॉडलों और 34,000 प्रश्नों के प्रदर्शन का विश्लेषण करते हुए, यह उपकरण सुरक्षा और सामान्य तर्क जैसे मिश्रित क्षमताओं को अलग करता है जो अक्सर बेंचमार्क स्कोर को छिपा देते हैं।
- BenchMIRT ने पूर्व लेबलिंग के बिना सुरक्षा और सामान्य तर्क को प्रभावी आयामों के रूप में स्वतंत्र रूप से पुनः प्राप्त किया।
- इसने दिखाया कि BBQ और WMDP जैसे बेंचमार्क्स अपने इच्छित सुरक्षा फोकस की तुलना में सामान्य तर्क के साथ अधिक मजबूती से सहसंबंधित हैं।
- विधि सबसे जानकारीपूर्ण प्रश्नों को पहचानती है, यह दिखाते हुए कि केवल 10% आइटम रखने से लगभग समान क्षमता मूल्यांकन बनाए रखा जा सकता है।
- BenchMIRT 79% सटीकता के साथ हल्ड-आउट प्रश्नों की सही उत्तर देने की भविष्यवाणी करता है, जो सरल बेलाइन दृष्टिकोणों से बेहतर है।
यह दृष्टिकोण शोधकर्ताओं को यह समझने में मदद करता है कि बेंचमार्क्स वास्तव में क्या मापते हैं और कम जानकारीपूर्ण प्रश्नों को हटाकर अधिक कुशल और केंद्रित मूल्यांकन डिजाइन करने में सक्षम बनाता है।