英国人工智能安全研究所(AISI)已通过 EvalEval 的 Evaluation Cards 平台公开了评估方法和发现,以提高基准测试的可复现性。此次发布包含五个特定基准测试的验证结果、背景信息和配置信息:HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro 和 Terminal-Bench 2.0。
- 数据涵盖六个前沿模型:Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2 和 GPT-5.4。
- 还包括来自两项网络评估(Cyber CTFs 和 The Last Ones)的额外结果,使用了部分重叠的模型集。
- 此次发布伴随 AISI 关于推理计算如何塑造前沿大语言模型评估的论文,强调 Humanity's Last Exam 的性能会随评估协议和 token 数量而变化。
公开带有设置信息的评估结果使研究人员能够仔细审查研究、跨生态系统比较发现,并理解设置选择如何影响报告的绩效。