영국 AI 보안 연구소(AISI)는 EvalEval의 Evaluation Cards 플랫폼을 통해 벤치마크 재현성을 개선하기 위해 공개 보고된 평가 방법과 결과를 제공했습니다. 이번 릴리스에는 HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, Terminal-Bench 2.0 등 5개 특정 벤치마크에 대한 검증된 결과, 컨텍스트 및 구성 정보가 포함됩니다.

  • 데이터는 Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2, GPT-5.4 등 6개 프론티어 모델을 다룹니다.
  • Cyber CTFs와 The Last Ones라는 두 가지 사이버 평가에서 추가 결과가 부분적으로 겹치는 모델 세트를 사용하여 포함되었습니다.
  • 이번 릴리스는 추론 컴퓨팅이 프론티어 LLM 평가에 미치는 영향에 대한 AISI의 논문과 함께 제공되며, Humanity's Last Exam에서의 성능이 평가 프로토콜과 토큰 수에 따라 달라진다는 점을 강조합니다.

설정 정보를 포함한 결과를 공개적으로 출시함으로써 연구자들은 연구를 면밀히 검토하고 생태계 전반에 걸쳐 결과를 비교하며 설정 선택이 보고된 성능에 어떤 영향을 미치는지 이해할 수 있습니다.