AISI, 5개 벤치마크에서 6개 프론티어 모델에 대한 검증된 평가 결과 공개
영국 AI 보안 연구소(AISI)는 EvalEval의 Evaluation Cards 플랫폼을 통해 벤치마크 재현성을 개선하기 위해 공개 보고된 평가 방법과 결과를 제공했습니다. 이번 릴리스에는 HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, Terminal-Bench 2.0 등 5개 특정 벤치마크에 대한 검증된 결과, 컨텍스트 및 구성 정보가 포함됩니다.