Pesquisadores demonstram que a ablação direcional, um ataque white-box que remove a recusa ao projetar para fora uma única direção dos pesos, permanece eficaz em modelos frontier mixture-of-experts (MoE) como o GLM-5.3-Flash. O estudo mostra que, embora o ataque sobreviva à arquitetura, seus efeitos são distribuídos entre os escritores de atenção, densos e de especialistas roteados, em vez de concentrados em um único local.

  • A edição dos escritores de atenção, densos e de especialistas roteados individualmente remove 0,039, 0,016 e 0,148 da recusa, respectivamente.
  • A intervenção conjunta nos três componentes remove 0,776 da recusa, com 74% do efeito existente apenas sob essa edição combinada.
  • A correspondência convencional por nome de módulo explica apenas 0,066 do efeito total, fazendo com que o ataque falhe silenciosamente se aplicado de forma restrita.
  • O método alcança reduções de 41 a 89 pontos percentuais em sete benchmarks prejudiciais sem mudanças detectadas na capacidade.
  • Um resíduo concentrado por categoria sobrevive às edições sobre violência, conteúdo sexual e ódio, deixando recusa mensurável em todos os postos de 1 a 12.

As descobertas indicam que o alinhamento de segurança em modelos MoE é mais frágil do que se pensava anteriormente, pois os componentes críticos para a recusa estão dispersos e não são facilmente identificados por métodos de inspeção padrão.