본 기사는 EvalAudit를 소개합니다. 이는 승자나 전체 순위와 같은 벤치마크 결론이 선언된 평가자 사양 계열 전반에서 식별되는지 여부를 결정하기 위해 설계된 실행 가능한 아티팩트입니다. 평가 대상 시스템과 데이터를 고정하고 지표 및 집계 규칙을 변화시킴으로써, 이 도구는 가능한 주장들의 집합이 단일 요소로 남는지 계산합니다.
저자들은 EvalAudit를 세 가지 이질적인 벤치마크에 적용했습니다: AgentDojo v0.1.35, AutoML Benchmark, 그리고 BEIR SciFact입니다. 결과 승자는 허용 및 논쟁된 사양 전반에서 종종 안정적이었지만, 전체 순위는 민감도 범위 내에서 항상 식별되지는 않았습니다. 이 도구는 사용자가 각 후보 사양에 대해 의미적 목표, 선택지의 변화, 그리고 증거를 선언하도록 요구합니다.
EvalAudit는 상위 점수를 재생성하지 않고도 고정된 점수 선언으로부터 결정론적 감사의 저비용 복제를 가능하게 합니다. 이는 샘플링 및 확률적 불확실성에서 의미적 불확실성을 분리하며, 검증을 위해 정규화된 JSON 보고서와 체크섬으로 닫힌 매니페스트를 제공합니다.