معهد أمان الذكاء الاصطناعي البريطاني ينشر نتائج تقييم موثقة لستة نماذج متقدمة على خمسة معايير
أتاح معهد أمان الذكاء الاصطناعي البريطاني (AISI) طرق التقييم والنتائج المنشورة علناً عبر منصة بطاقات التقييم الخاصة بـ EvalEval لتحسين إمكانية إعادة إنتاج المعايير. تتضمن هذه الإصدار نتائج موثقة، وسياقاً، ومعلومات حول التكوين لخمسة معايير محددة: HealthBench، وFrontierMath، وHumanity's Last Exam، وSWE-Bench Pro، وTerminal-Bench 2.0.