arxiv
arXiv cs.CL
·
há 21 d
·
33 visualizações
Ataque unidirecional no GLM-5.3-Flash revela fragilidade do alinhamento de segurança em modelos MoE
Pesquisadores demonstram que a ablação direcional, um ataque white-box que remove a recusa ao projetar para fora uma única direção dos pesos, permanece eficaz em modelos frontier mixture-of-experts (MoE) como o GLM-5.3-Flash. O estudo mostra que, embora o ataque sobreviva à arquitetura, seus efeitos são distribuídos entre os escritores de atenção, densos e de especialistas roteados, em vez de concentrados em um único local.