लेख EvalAudit का परिचय देता है, जो एक कार्यशील आर्टिफैक्ट है जिसे इस बात को निर्धारित करने के लिए डिज़ाइन किया गया है कि क्या एक बेंचमार्क निष्कर्ष—जैसे विजेता या पूर्ण रैंकिंग—एक घोषित मूल्यांकनकर्ता विनिर्देशों के परिवार में पहचाना जाता है। मूल्यांकन की गई प्रणालियों और डेटा को स्थिर रखते हुए, जबकि मापदंडों और एग्रीगेशन नियमों को बदलते हुए, टूल यह गणना करता है कि संभावित दावों का सेट एक सिंगलटोन बना हुआ है या नहीं।

लेखकों ने EvalAudit को तीन विषम बेंचमार्क्स पर लागू किया: AgentDojo v0.1.35, AutoML Benchmark, और BEIR SciFact। परिणामों से पता चला कि जबकि विजेता अक्सर स्वीकृत और विवादित विनिर्देशों में स्थिर रहे, पूर्ण रैंकिंग संवेदनशीलता एनवलप के भीतर हमेशा पहचाने नहीं गए। टूल को उपयोगकर्ताओं को प्रत्येक उम्मीदवार विनिर्देश के लिए अर्थपूर्ण लक्ष्यों, बदलाव वाले चयनों और सबूतों की घोषणा करनी होती है।

EvalAudit जमा किए गए स्कोर घोषणाओं से निर्धारित ऑडिट का कम लागत वाला पुनरुत्पादन सक्षम बनाता है, बिना अपस्ट्रीम स्कोर को फिर से जनरेट किए। यह नमूना और यादृच्छिक अनिश्चितता से अर्थपूर्ण अनिश्चितता को अलग करता है, सत्यापन के लिए सामान्यीकृत JSON रिपोर्ट और चेकसम-बंद मैनिफेस्ट प्रदान करता है।