Sebuah buku besar peer-to-peer dengan gerbang etika fail-closed yang terdiri dari pengklasifikasi bag-of-words yang didistilasi, tempat semantik, dan panel model terbuka kecil (qwen2.5:7b, llama3.2:3b, gemma2:2b) mengungkapkan bahwa hakim yang berbagi fitur menunjukkan kesalahan berkorelasi daripada kesalahan independen.

  • Dari 1.226 pelanggaran berlabel, hakim distilasi dan model Naive Bayes dengan fitur sama secara keliru mengakui transaksi yang sama sebanyak 4,3% dari waktu, sekitar 7,7 kali lebih tinggi dari 0,56% yang diharapkan jika kesalahan mereka independen.
  • Evaluasi menunjukkan bahwa hakim distilasi secara keliru mengakui 3,4% pelanggaran berlabel (2,6 hingga 4,3) dibandingkan dengan 23,9% untuk model fitur sama yang dipaksa memutuskan, sambil mengalami tingkat abstain sebesar 34,8%.
  • Dataset berisi 3.444 label dihasilkan oleh panel tiga model terbuka kecil dengan Fleiss’ kappa sebesar 0,857 atas 374 baris yang divoting, tanpa melibatkan pelabelan manusia.

Temuan ini menunjukkan bahwa keberagaman implementasi tidak menjamin independensi kesalahan untuk hakim yang berbagi fitur dan data pelatihan, menantang asumsi independensi dalam desain majority-of-graders.