英国AIセキュリティ研究所(AISI)は、ベンチマークの再現性を向上させるため、EvalEvalのEvaluation Cardsプラットフォームを通じて公に報告された評価手法と知見を公開しました。今回のリリースには、HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro、Terminal-Bench 2.0という5つの特定のベンチマークに関する検証済み結果、文脈、および設定情報が含まれています。

  • データは6つの最先端モデルをカバーしています:Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2、およびGPT-5.4。
  • Cyber CTFsとThe Last Onesという2つのサイバー評価からの追加結果が、部分的に重複するモデルセットを使用して含まれています。
  • このリリースには、推論計算資源が最先端LLMの評価にどのように影響を与えるかに関するAISIの論文も伴っており、Humanity's Last Examでのパフォーマンスは評価プロトコルとトークン数によって変化することが強調されています。

設定情報付きで結果を公開することで、研究者は研究を詳細に検討し、エコシステム全体で知見を比較し、設定の選択が報告されたパフォーマンスにどのように影響するかを理解することができます。