Institut Keamanan AI Inggris (AISI) telah membuat metode dan temuan evaluasi yang dilaporkan secara publik tersedia melalui platform Kartu Evaluasi EvalEval untuk meningkatkan reproduktibilitas benchmark. Rilis ini mencakup hasil terverifikasi, konteks, dan informasi konfigurasi untuk lima benchmark spesifik: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, dan Terminal-Bench 2.0.

  • Data mencakup enam model terdepan: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2, dan GPT-5.4.
  • Hasil tambahan dari dua evaluasi siber, Cyber CTFs dan The Last Ones, disertakan menggunakan seperangkat model yang tumpang tindih sebagian.
  • Rilis ini disertai makalah AISI tentang bagaimana komputasi inferensi membentuk evaluasi LLM terdepan, menyoroti bahwa kinerja pada Humanity's Last Exam berubah seiring protokol evaluasi dan jumlah token.

Pelepasan hasil secara terbuka dengan informasi setup memungkinkan peneliti untuk mempelajari studi secara mendalam, membandingkan temuan di seluruh ekosistem, dan memahami bagaimana pilihan setup memengaruhi kinerja yang dilaporkan.