كشف دفتر أقران إلى أقران يحتوي على بوابة أخلاقية ذات فشل مغلق، مؤلفة من مصنف كيس كلمات مُكثّف، ومقعد دلالي، ولجنة من نماذج مفتوحة صغيرة (qwen2.5:7b, llama3.2:3b, gemma2:2b)، أن القضاة الذين يشاركون الميزات يُظهرون أخطاء مترابطة بدلاً من أخطاء مستقلة.
- من بين 1,226 انتهافاً مُعلَّماً، قبل القاضي المُكثّف ونموذج بايز البسيط ذو الميزات نفسها نفس المعاملة خطأً بنسبة 4.3% من الوقت، وهو ما يعادل تقريباً 7.7 أضعاف القيمة المتوقعة البالغة 0.56% لو كانت أخطاؤهم مستقلة.
- أظهر التقييم أن القاضي المُكثّف يقبل خطأً 3.4% من الانتهافات المُعلَّمة (بين 2.6 و4.3) مقارنة بـ 23.9% للنموذج ذي الميزات نفسها المُجبر على اتخاذ القرار، بينما سجل معدل امتناع عن التصويت بنسبة 34.8%.
- وُلِّد مجموعة البيانات المكونة من 3,444 تسمية بواسطة لجنة من ثلاثة نماذج مفتوحة صغيرة، بمقياس فيليس كابي (Fleiss’ kappa) يبلغ 0.857 عبر 374 صفّاً مُصوّتاً، دون أي تدخل بشري في التعليل.
تشير النتائج إلى أن تنوع التنفيذ لا يضمن استقلالية الأخطاء للقضاة الذين يشاركون الميزات وبيانات التدريب، مما يتحدى افتراض الاستقلالية في تصاميم الأغلبية من المقيّمين.