arxiv
arXiv cs.CL
·
il y a 21 j
·
33 vues
Une attaque unidirectionnelle sur GLM-5.3-Flash révèle la fragilité de l'alignement de sécurité dans les modèles MoE
Les chercheurs démontrent que l'ablation directionnelle, une attaque en boîte blanche qui supprime le refus en projetant hors d'une seule direction à partir des poids, reste efficace sur les modèles de pointe à mélange d'experts (MoE) tels que GLM-5.3-Flash. L'étude montre que bien que l'attaque survive à l'architecture, ses effets sont répartis entre les rédacteurs d'attention, denses et d'experts routés plutôt que concentrés en un seul endroit.