Les chercheurs démontrent que l'ablation directionnelle, une attaque en boîte blanche qui supprime le refus en projetant hors d'une seule direction à partir des poids, reste efficace sur les modèles de pointe à mélange d'experts (MoE) tels que GLM-5.3-Flash. L'étude montre que bien que l'attaque survive à l'architecture, ses effets sont répartis entre les rédacteurs d'attention, denses et d'experts routés plutôt que concentrés en un seul endroit.
- La modification des rédacteurs d'attention, denses et d'experts routés individuellement supprime respectivement 0,039, 0,016 et 0,148 du refus.
- Une intervention conjointe sur les trois composants supprime 0,776 du refus, avec 74 % de l'effet existant uniquement sous cette modification combinée.
- La correspondance conventionnelle par nom de module ne rend compte que de 0,066 de l'effet total, ce qui entraîne un échec silencieux de l'attaque si elle est appliquée de manière étroite.
- La méthode réalise des réductions de 41 à 89 points de pourcentage sur sept benchmarks nuisibles sans changements détectés dans les capacités.
- Un résidu concentré par catégorie survit aux modifications sur la violence, le contenu sexuel et la haine, laissant un refus mesurable à chaque rang de 1 à 12.
Les résultats indiquent que l'alignement de sécurité dans les modèles MoE est plus fragile qu'on ne le pensait, car les composants critiques pour le refus sont dispersés et ne sont pas facilement identifiables par des méthodes d'inspection standard.