研究人员表明,方向消融(directional ablation)这一通过从权重中投影去除单一方向来移除拒绝行为的白盒攻击,在前沿混合专家(MoE)模型(如GLM-5.3-Flash)上仍然有效。研究表明,尽管该攻击能够穿透架构,但其影响分布在注意力层、密集层和路由专家写入器之间,而非集中在某一位置。
- 单独编辑注意力、密集和路由专家写入器分别移除0.039、0.016和0.148的拒绝行为。
- 对这三个组件进行联合干预可移除0.776的拒绝行为,其中74%的效果仅在此组合编辑下存在。
- 传统的模块名称匹配仅能解释总效果的0.066,若狭隘地应用会导致攻击无声失败。
- 该方法在七个有害基准测试中实现了41-89个百分点的降低,且未检测到能力变化。
- 暴力、色情内容和仇恨类别的残留效应经编辑后仍然存在,导致从第1层到第12层的每一层级都保留了可测量的拒绝行为。
研究结果表明,MoE模型的安全对齐比此前认为的更为脆弱,因为关键的拒绝组件是分散的,无法通过标准检查方法轻易识别。