Um livro-razão ponto a ponto com uma porta de ética fail-closed composta por um classificador bag-of-words destilado, um assento semântico e um painel de pequenos modelos abertos (qwen2.5:7b, llama3.2:3b, gemma2:2b) revela que juízes que compartilham características exibem erros correlacionados em vez de independentes.
- Entre 1.226 violações rotuladas, o juiz destilado e um modelo Naive Bayes com mesmas características admitiram erroneamente a mesma transação 4,3% das vezes, aproximadamente 7,7 vezes maior do que os 0,56% esperados se seus erros fossem independentes.
- A avaliação mostra que o juiz destilado admite erroneamente 3,4% das violações rotuladas (2,6 a 4,3) em comparação com 23,9% para o modelo de mesmas características forçado a decidir, enquanto incorre em uma taxa de abstenção de 34,8%.
- O conjunto de dados de 3.444 rótulos foi gerado por um painel de três pequenos modelos abertos com kappa de Fleiss de 0,857 sobre 374 linhas votadas, sem envolvimento de rotulagem humana.
Os resultados indicam que a diversidade de implementação não garante independência de erro para juízes que compartilham características e dados de treinamento, desafiando a suposição de independência em designs baseados na maioria dos avaliadores.