Artikel ini memperkenalkan EvalAudit, sebuah artefak yang dapat dieksekusi untuk menentukan apakah kesimpulan benchmark—seperti pemenang atau peringkat lengkap—diidentifikasi di seluruh keluarga spesifikasi evaluator yang dinyatakan. Dengan memperbaiki sistem dan data yang dievaluasi sambil memvariasikan metrik dan aturan agregasi, alat ini menghitung apakah kumpulan klaim yang mungkin tetap berupa satu elemen tunggal.

Para penulis menerapkan EvalAudit pada tiga benchmark heterogen: AgentDojo v0.1.35, AutoML Benchmark, dan BEIR SciFact. Hasil menunjukkan bahwa meskipun pemenang sering kali stabil di seluruh spesifikasi yang diterima dan dipertanyakan, peringkat lengkap tidak selalu teridentifikasi dalam ambang sensitivitas. Alat ini mengharuskan pengguna untuk menyatakan target semantik, pilihan yang bervariasi, dan bukti untuk setiap kandidat spesifikasi.

EvalAudit memungkinkan reproduksi audit deterministik dengan biaya rendah dari deklarasi skor beku tanpa menghasilkan ulang skor hulu. Alat ini memisahkan ketidakpastian semantik dari ketidakpastian pengambilan sampel dan stokastik, menyediakan laporan JSON terstandarisasi dan manifest tertutup checksum untuk verifikasi.