Исследователи демонстрируют, что направленная абляция — атака с открытым исходным кодом, устраняющая отказ путем проецирования одного направления из весов, остается эффективной для передовых моделей смешанных экспертов (MoE), таких как GLM-5.3-Flash. Исследование показывает, что хотя атака выживает в архитектуре, ее эффекты распределяются по вниманию, плотным и маршрутизируемым экспертам, а не сосредоточены в одном месте.
- Редактирование внимания, плотности и маршрутизируемых экспертов по отдельности устраняет 0.039, 0.016 и 0.148 отказа соответственно.
- Совместное вмешательство во все три компонента устраняет 0.776 отказа, при этом 74% эффекта существует только при этом комбинированном редактировании.
- Обычное сопоставление имен модулей объясняет лишь 0.066 от общего эффекта, что приводит к тихому провалу атаки при узком применении.
- Метод достигает снижения на 41-89 процентных пунктов по семи вредным бенчмаркам без обнаруженных изменений в возможностях.
- Категория-концентрированный остаток выживает после редактирования насилия, сексуального контента и ненависти, оставляя измеримый отказ на каждом ранге от 1 до 12.
Выводы указывают на то, что безопасность выравнивания в моделях MoE более хрупка, чем считалось ранее, поскольку критические компоненты для отказа разбросаны и не легко идентифицируются стандартными методами инспекции.