UK AI Security Institute (AISI) ने बेंचमार्क पुनरुत्पादन को बेहतर बनाने के लिए EvalEval के Evaluation Cards प्लेटफ़ॉर्म के माध्यम से सार्वजनिक रूप से रिपोर्ट की गई मूल्यांकन विधियों और निष्कर्षों को उपलब्ध कराया है। इस रिलीज़ में पांच विशिष्ट बेंचमार्क: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, और Terminal-Bench 2.0 के लिए सत्यापित परिणाम, संदर्भ और कॉन्फ़िगरेशन जानकारी शामिल है।
- डेटा छह फ्रंटियर मॉडल को कवर करता है: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2, और GPT-5.4।
- Cyber CTFs और The Last Ones नामक दो साइबर मूल्यांकनों से अतिरिक्त परिणाम आंशिक रूप से ओवरलैपिंग मॉडल सेट का उपयोग करके शामिल किए गए हैं।
- इस रिलीज़ के साथ AISI ने वह पेपर जारी किया है जो दर्शाता है कि इन्फ़रेंस कंप्यूट फ्रंटियर LLM मूल्यांकन को कैसे आकार देता है, जिसमें यह उजागर किया गया है कि Humanity's Last Exam पर प्रदर्शन मूल्यांकन प्रोटोकॉल और टोकन गिनती के साथ बदलता है।
सेटअप जानकारी के साथ परिणामों को खुले तौर पर जारी करने से शोधकर्ताओं को अध्ययनों को निकटता से देखने, पूरे इकोसिस्टम में निष्कर्षों की तुलना करने और यह समझने में सहायता मिलती है कि सेटअप के चयन रिपोर्ट किए गए प्रदर्शन को कैसे प्रभावित करते हैं।