AISI ने पांच बेंचमार्क पर छह फ्रंटियर मॉडल के लिए सत्यापित मूल्यांकन परिणाम जारी किए
UK AI Security Institute (AISI) ने बेंचमार्क पुनरुत्पादन को बेहतर बनाने के लिए EvalEval के Evaluation Cards प्लेटफ़ॉर्म के माध्यम से सार्वजनिक रूप से रिपोर्ट की गई मूल्यांकन विधियों और निष्कर्षों को उपलब्ध कराया है। इस रिलीज़ में पांच विशिष्ट बेंचमार्क: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, और Terminal-Bench 2.0 के लिए सत्यापित परिणाम, संदर्भ और कॉन्फ़िगरेशन जानकारी शामिल है।