Un libro mayor peer-to-peer con una puerta ética fail-closed compuesta por un clasificador bag-of-words destilado, un asiento semántico y un panel de pequeños modelos abiertos (qwen2.5:7b, llama3.2:3b, gemma2:2b) revela que los jueces que comparten características exhiben errores correlacionados en lugar de independientes.
- Entre 1.226 infracciones etiquetadas, el juez destilado y un modelo Naive Bayes con mismas características admitieron erróneamente la misma transacción el 4,3 % del tiempo, aproximadamente 7,7 veces más alto que el 0,56 % esperado si sus errores fueran independientes.
- La evaluación muestra que el juez destilado admite erróneamente el 3,4 % de las infracciones etiquetadas (2,6 a 4,3) en comparación con el 23,9 % para el modelo de mismas características obligado a decidir, mientras incurre en una tasa de abstención del 34,8 %.
- El conjunto de datos de 3.444 etiquetas fue generado por un panel de tres pequeños modelos abiertos con kappa de Fleiss de 0,857 sobre 374 filas votadas, sin intervención de etiquetado humano.
Los hallazgos indican que la diversidad de implementación no garantiza la independencia del error para jueces que comparten características y datos de entrenamiento, desafiando el supuesto de independencia en diseños de mayoría de evaluadores.