由蒸馏词袋分类器、语义席位和小型开源模型(qwen2.5:7b, llama3.2:3b, gemma2:2b)组成的评审团所构成的失败关闭机制伦理门控显示,共享特征的评审者表现出的是相关性误差而非独立误差。
- 在1,226个标注违规中,蒸馏评审者与具有相同特征的朴素贝叶斯模型错误地允许了相同的交易,发生率为4.3%,这比假设其误差相互独立时预期的0.56%高出约7.7倍。
- 评估显示,蒸馏评审者错误地允许了2.6%至4.3%(平均3.4%)的标注违规,而强制决策的同特征模型这一比例为23.9%,同时其弃权率为34.8%。
- 包含3,444个标签的数据集由三个小型开源模型组成的评审团生成,在374行投票数据上的Fleiss’ kappa系数为0.857,未涉及人工标注。
研究结果表明,对于共享特征和训练数据的评审者而言,实现方式的多样性并不能保证误差的独立性,这挑战了多数评分者设计中关于独立性的假设。