AISI merilis hasil evaluasi terverifikasi untuk enam model terdepan pada lima benchmark
Institut Keamanan AI Inggris (AISI) telah membuat metode dan temuan evaluasi yang dilaporkan secara publik tersedia melalui platform Kartu Evaluasi EvalEval untuk meningkatkan reproduktibilitas benchmark. Rilis ini mencakup hasil terverifikasi, konteks, dan informasi konfigurasi untuk lima benchmark spesifik: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, dan Terminal-Bench 2.0.