연구자들은 방향성 아블레이션(단일 방향을 가중치에서 제거하여 거부를 제거하는 화이트박스 공격)이 GLM-5.3-Flash와 같은 최전선 혼합 전문가(MoE) 모델에서도 효과적임을 입증했습니다. 이 연구는 공격이 아키텍처를 극복하지만, 그 효과가 한 곳에 집중되지 않고 어텐션, 밀집(dense), 라우팅된 전문가 작성자 전반에 분산되어 있음을 보여줍니다.
- 어텐션, 밀집, 라우팅된 전문가 작성자를 개별적으로 편집하면 각각 0.039, 0.016, 0.148의 거부가 제거됩니다.
- 세 구성 요소 모두에 공동 개입하면 0.776의 거부가 제거되며, 효과의 74%는 이 결합된 편집 하에서만 존재합니다.
- 기존 모듈 이름 매칭은 전체 효과의 0.066만 설명하므로, 좁게 적용할 경우 공격이 감지되지 않고 실패하게 됩니다.
- 이 방법은 능력의 감지된 변화 없이 일곱 가지 유해 벤치마크에서 41~89 퍼센트포인트의 감소를 달성합니다.
- 폭력, 성 콘텐츠, 혐오에 대한 편집 후에도 카테고리 집중 잔류물이 남아 있어 1부터 12까지 모든 순위에서 측정 가능한 거부가 유지됩니다.
이 결과는 안전 정렬이 표준 검사 방법으로 쉽게 식별되지 않는 분산된 구성 요소에 의존하기 때문에 MoE 모델의 안전 정렬이 기존 생각보다 더 취약함을 시사합니다.