Un registre pair-à-pair avec une porte éthique à fermeture échouée composée d'un classificateur sac-de-mots distillé, d'un siège sémantique et d'un panel de petits modèles ouverts (qwen2.5:7b, llama3.2:3b, gemma2:2b) révèle que les juges partageant des caractéristiques présentent des erreurs corrélées plutôt qu'indépendantes.
- Parmi 1 226 violations étiquetées, le juge distillé et un modèle de Bayes naïf aux mêmes caractéristiques ont incorrectement admis la même transaction 4,3 % du temps, environ 7,7 fois plus élevé que les 0,56 % attendus si leurs erreurs étaient indépendantes.
- L'évaluation montre que le juge distillé admet incorrectement 3,4 % des violations étiquetées (2,6 à 4,3) par rapport à 23,9 % pour le modèle aux mêmes caractéristiques forcé de décider, tout en affichant un taux d'abstention de 34,8 %.
- Le jeu de données de 3 444 étiquettes a été généré par un panel de trois petits modèles ouverts avec un kappa de Fleiss de 0,857 sur 374 lignes votées, sans aucune intervention humaine dans l'étiquetage.
Les résultats indiquent que la diversité des implémentations ne garantit pas l'indépendance des erreurs pour les juges partageant des caractéristiques et des données d'entraînement, remettant en cause l'hypothèse d'indépendance dans les conceptions à majorité de notateurs.