本記事では、宣言された評価者仕様のファミリ全体でベンチマークの結論(勝者や完全なランキングなど)が特定されるかどうかを判定するために設計された実行可能なアーティファクトであるEvalAuditを紹介します。評価対象のシステムとデータを固定し、指標と集計ルールを変化させることで、ツールは可能な主張の集合が単一要素に留まるかどうかを計算します。
著者はEvalAuditを3つの異種ベンチマーク(AgentDojo v0.1.35、AutoML Benchmark、BEIR SciFact)に適用しました。その結果、勝者は承認された仕様と争われた仕様の間で安定していることが多かったものの、完全なランキングは感度包絡内で常に特定されるとは限らないことが示されました。ツールはユーザーが各候補仕様に対して意味的な目標、変化させる選択肢、および証拠を宣言することを要求します。
EvalAuditは、上位のスコアを再生成することなく、凍結されたスコア宣言からの決定論的監査のコスト効率の良い再現を可能にします。これは、サンプリングおよび確率的な不確実性から意味的な不確実性を分離し、検証用の正規化されたJSONレポートとチェックサム閉じたマニフェストを提供します。