Распределённый реестр с этическим фильтром, отказывающим при сбое, состоящий из дистиллированного классификатора на основе мешка слов, семантического ядра и панели небольших открытых моделей (qwen2.5:7b, llama3.2:3b, gemma2:2b), показывает, что судьи, обладающие общими чертами, демонстрируют коррелированные ошибки, а не независимые.
- Среди 1 226 помеченных нарушений дистиллированный судья и наивная байесовская модель с общими чертами ошибочно допускали одну и ту же транзакцию в 4,3% случаев, что примерно в 7,7 раза выше ожидаемых 0,56%, если бы их ошибки были независимыми.
- Оценка показывает, что дистиллированный судья ошибочно допускает 3,4% помеченных нарушений (от 2,6 до 4,3), по сравнению с 23,9% для модели с общими чертами, вынужденной принимать решение, при этом уровень воздержания составляет 34,8%.
- Набор данных из 3 444 меток был сгенерирован панелью из трёх небольших открытых моделей с коэффициентом Каппы Флейсса 0,857 по 374 проголосованным строкам, без участия человека в разметке.
Полученные результаты указывают на то, что разнообразие реализаций не гарантирует независимость ошибок для судей, обладающих общими чертами и обучающими данными, ставя под сомнение предположение о независимости в конструкциях с большинством оценок.