研究者たちは、重みから単一方向を投影して拒否を除去するホワイトボックス攻撃である方向性アブレーションが、GLM-5.3-Flashのような最先端の混合专家(MoE)モデルに対して依然として有効であることを実証した。本研究は、この攻撃がアーキテクチャを生き残る一方で、その効果が1つの場所に集中するのではなく、注意機構、密結合層、ルーティングされた专家の書き込み器全体に分散されていることを示している。
- 注意機構、密結合層、ルーティングされた专家の書き込み器を個別に編集すると、拒否がそれぞれ0.039、0.016、0.148減少する。
- これら3つのコンポーネントすべてに対して同時介入を行うと、拒否が0.776除去され、その効果の74%はこの組み合わせ編集下でのみ存在する。
- 従来のモジュール名マッチングは総効果の0.066しか説明できず、狭く適用されると攻撃が静かに失敗する原因となる。
- この手法は、能力の変化が検出されないまま、7つの有害なベンチマークで41〜89パーセントポイントの減少を実現した。
- 暴力、性的コンテンツ、ヘイトに関する編集にはカテゴリー集中型の残留物が残り、ランク1から12までのすべての階層で測定可能な拒否が残存している。
これらの知見は、拒否に必要な重要コンポーネントが分散しており、標準的な検査手法では容易に特定できないため、MoEモデルの安全アライメントは以前考えられていたよりも脆弱であることを示唆している。