蒸留されたbag-of-words分類器、セマンティックシート、および小規模なオープンモデル(qwen2.5:7b、llama3.2:3b、gemma2:2b)のパネルで構成されるフェイルクローズドの倫理ゲートを持つピアツーピア台帳は、特徴を共有する審査員が独立したエラーではなく相関したエラーを示すことを明らかにしている。

  • 1,226件のラベル付き違反のうち、蒸留された審査員と同一特徴を持つナイーブベイズモデルは、同じトランザクションを4.3%の頻度で誤って許可しており、これはエラーが独立していた場合に期待される0.56%よりも約7.7倍高い。
  • 評価結果では、蒸留された審査員はラベル付き違反の3.4%(2.6〜4.3)を誤って許可しているのに対し、決定を強制された同一特徴モデルは23.9%であり、 abstention rateは34.8%となっている。
  • 3,444件のラベルからなるデータセットは、374件の投票済み行でFleiss’ kappaが0.857となる3つの小規模オープンモデルのパネルによって生成され、人間のラベリングは含まれていない。

これらの知見は、実装の多様性が特徴とトレーニングデータを共有する審査員のエラーの独立性を保証しないことを示しており、多数決設計における独立性の仮定に疑問を投げかけている。