本文介绍了 EvalAudit,这是一种可执行工件,旨在确定在声明的评估器规范族中是否识别出基准结论——例如获胜者或完整排名。通过固定被评估的系统和数据,同时变化指标和聚合规则,该工具计算可能的主张集合是否为单例。
作者将 EvalAudit 应用于三个异构基准:AgentDojo v0.1.35、AutoML Benchmark 和 BEIR SciFact。结果表明,虽然获胜者在公认和争议规范中通常保持稳定,但完整排名并不总是在灵敏度包络内被识别。该工具要求用户声明语义目标、变化选择和每个候选规范的证据。
EvalAudit 使得无需重新生成上游分数即可低成本复现来自冻结分数声明的确定性审计成为可能。它将语义不确定性从采样和随机不确定性中分离出来,提供标准化的 JSON 报告和用于验证的校验和封闭清单。