EvalAwareBench का उपयोग करने वाला एक अध्ययन परीक्षण करता है कि क्या भाषा मॉडल मूल्यांकन संदर्भों की पहचान के लिए एक साझित दिशा या कई संकेत-विशिष्ट डिटेक्टर का उपयोग करते हैं। शोध ने 1,298 प्रॉम्प्ट्स पर अंतर्निहित कार्यों और इकाइयों को स्थिर रखते हुए आठ ट्रिगर कारकों को स्वतंत्र रूप से टॉगल किया।

  • Qwen3 (0.6B–14B) और Gemma 3 (270M/1B) मॉडल्स का विश्लेषण दर्शाता है कि प्रति-संकेत दिशाएं मापनीय कोसाइन विश्वसनीयता की छत का केवल ~20% हैं, जो एक साझित अक्ष के बजाय भिन्न डिटेक्टरों की ओर इशारा करता है।
  • स्पष्ट मूल्यांकन विवरण प्रमुख कारक है, जिसमें वैश्विक दिशा के लिए कोसाइन समानता ~0.89 है; इसे अलग से हटाने से eval/deploy सिग्नल का 36–57% नुकसान होता है।
  • उत्तेजना की कृत्रिमता वैश्विक दिशा पर संयोग (AUROC 0.52) के स्तर पर पढ़ी जाती है, भले ही मॉडल इसे एक समर्पित दिशा 0.68 के साथ अन्यथा दर्शाता है।
  • मूल्यांकन फ्रेमिंग क्षमता को नहीं बढ़ाता है लेकिन उत्तर देने की इच्छा को महत्वपूर्ण रूप से बदल देता है, जिसमें माध्य शीर्ष-अक्षर लॉग-संभावना 14B पर डिप्लॉयमेंट में -16.68 से मूल्यांकन में -3.90 तक बदल जाती है।

निष्कर्ष सुझाव देते हैं कि मूल्यांकन जागरूकता एक साझित वैश्विक अक्ष के बजाय संकेत-विशिष्ट डिटेक्टरों का समूह है, जिसमें स्पष्ट विवरण प्रभावी कारक है।