تقدم المقالة أداة EvalAudit، وهي أثر قابل للتنفيذ صُمم لتحديد ما إذا كانت نتيجة معيار صارم - مثل الفائز أو الترتيب الكامل - تُحدَّد ضمن عائلة مُعلَنة من مواصفات المُقيِّم. ومن خلال تثبيت الأنظمة المُقيَّمة والبيانات مع تغيير المقاييس وقواعد التجميع، تحسب الأداة ما إذا كان مجموعة الادعاءات الممكنة تبقى عنصرًا واحدًا.

طبَّق المؤلفون أداة EvalAudit على ثلاثة معايير صارمة غير متجانسة: AgentDojo v0.1.35، وAutoML Benchmark، وBEIR SciFact. وأظهرت النتائج أنه بينما كانت الفائزات مستقرة غالبًا عبر المواصفات المقبولة والمُشكوك فيها، لم يكن الترتيب الكامل يُحدَّد دائمًا ضمن الغلاف الحساس. تتطلب الأداة من المستخدمين الإعلان عن الأهداف الدلالية، والخيارات المتغيرة، والأدلة لكل مواصفة مرشحة.

تُمكّن أداة EvalAudit من إعادة إنتاج تدقيقات حتمية منخفضة التكلفة من إعلانات الدرجات المجمدة دون إعادة توليد درجات المصدر. وهي تفصل بين عدم اليقين الدلالي وعدم اليقين العشوائي والعينات، وتوفر تقارير بتنسيق JSON مُطابَق وملفات تعريف ارتباط مغلقة بمجموع تحقق للتحقق.