एक फ़िल्टर्ड शब्द-बैग वर्गीकारक, एक अर्थवत स्थान, और छोटे खुले मॉडलों (qwen2.5:7b, llama3.2:3b, gemma2:2b) की पैनल से बने विफल-बंद नैतिकता गेट वाले पीयर-टू-पीयर लेजर ने दिखाया कि समान विशेषताओं वाले जज स्वतंत्र त्रुटियों के बजाय सहसंबद्ध त्रुटियाँ प्रदर्शित करते हैं।

  • 1,226 लेबल किए गए उल्लंघनों में, फ़िल्टर्ड जज और समान-विशेषताओं वाला नैवे बेयस मॉडल 4.3% समय तक एक ही लेनदेन को गलत रूप से स्वीकार करते हैं, जो यदि उनकी त्रुटियाँ स्वतंत्र होती तो अपेक्षित 0.56% से लगभग 7.7 गुना अधिक है।
  • मूल्यांकन दिखाता है कि फ़िल्टर्ड जज लेबल किए गए उल्लंघनों का 3.4% (2.6 से 4.3) गलत रूप से स्वीकार करता है, जबकि समान-विशेषताओं वाले मॉडल के लिए यह निर्णय लेने पर 23.9% होता है, और 34.8% अस्वीकृति दर का सामना करता है।
  • 3,444 लेबलों का डेटासेट तीन छोटे खुले मॉडलों की पैनल द्वारा उत्पन्न किया गया था, जिसमें 374 वोट किए गए पंक्तियों पर Fleiss’ kappa 0.857 था, और किसी मानव लेबलिंग में शामिल नहीं था।

निष्कर्ष संकेत करते हैं कि कार्यान्वयन की विविधता समान विशेषताओं और प्रशिक्षण डेटा वाले जजों के लिए त्रुटियों की स्वतंत्रता की गारंटी नहीं देती है, जो बहुमत-ग्रेडर्स डिज़ाइन में स्वतंत्रता की धारणा को चुनौती देती है।