Los investigadores demuestran que la ablación direccional, un ataque de caja blanca que elimina el rechazo proyectando fuera una única dirección desde los pesos, sigue siendo efectiva en modelos de vanguardia de mezcla de expertos (MoE) como GLM-5.3-Flash. El estudio muestra que, aunque el ataque sobrevive a la arquitectura, sus efectos se distribuyen entre los escritores de atención, densos y de expertos enrutados, en lugar de concentrarse en una sola ubicación.
- Editar individualmente los escritores de atención, densos y de expertos enrutados elimina 0.039, 0.016 y 0.148 del rechazo respectivamente.
- La intervención conjunta sobre los tres componentes elimina 0.776 del rechazo, con el 74% del efecto existente solo bajo esta edición combinada.
- La coincidencia convencional de nombres de módulos explica solo 0.066 del efecto total, provocando que el ataque falle silenciosamente si se aplica de manera estrecha.
- El método logra reducciones de 41 a 89 puntos porcentuales en siete benchmarks dañinos sin cambios detectados en la capacidad.
- Un residuo concentrado por categoría sobrevive a las ediciones sobre violencia, contenido sexual y odio, dejando un rechazo medible en cada rango desde 1 hasta 12.
Los hallazgos indican que el alineamiento de seguridad en modelos MoE es más frágil de lo que se pensaba anteriormente, ya que los componentes críticos para el rechazo están dispersos y no son fácilmente identificables mediante métodos de inspección estándar.