أتاح معهد أمان الذكاء الاصطناعي البريطاني (AISI) طرق التقييم والنتائج المنشورة علناً عبر منصة بطاقات التقييم الخاصة بـ EvalEval لتحسين إمكانية إعادة إنتاج المعايير. تتضمن هذه الإصدار نتائج موثقة، وسياقاً، ومعلومات حول التكوين لخمسة معايير محددة: HealthBench، وFrontierMath، وHumanity's Last Exam، وSWE-Bench Pro، وTerminal-Bench 2.0.
- تغطي البيانات ستة نماذج متقدمة: Claude Opus 4، وClaude Opus 4.5، وClaude Opus 4.6، وGPT-5، وGPT-5.2، وGPT-5.4.
- تتضمن نتائج إضافية من تقييمين أمنيين سيبرانيين هما Cyber CTFs وThe Last Ones باستخدام مجموعة جزئياً متداخلة من النماذج.
- يصاحب هذا الإصدار ورقة بحثية صادرة عن AISI حول كيفية تشكيل موارد الاستدلال لحسابات التقييم للنماذج اللغوية الكبيرة المتقدمة، مع تسليط الضوء على أن الأداء في Humanity's Last Exam يتغير وفقاً لبروتوكول التعداد وعدد الرموز.
يسمح الإفصاح العلني عن النتائج مع معلومات الإعداد للباحثين بفحص الدراسات عن كثب، ومقارنة النتائج عبر النظام البيئي، وفهم كيفية تأثير خيارات الإعداد على الأداء المبلغ عنه.