أظهر الباحثون أن الحذف الاتجاهي، وهو هجوم ذو صندوق أبيض يزيل الرفض من خلال إسقاط اتجاه واحد من الأوزان، يبقى فعالاً على نماذج المزج المتقدمة (MoE) مثل GLM-5.3-Flash. تُظهر الدراسة أنه بينما ينجو الهجوم من البنية المعمارية، فإن آثاره موزعة عبر كتّاب الانتباه والكثيفين والخبراء الموجهين بدلاً من تركيزها في موقع واحد.
- يؤدي تحرير كتّاب الانتباه والكثيفين والخبراء الموجهين بشكل فردي إلى إزالة 0.039 و0.016 و0.148 من الرفض على التوالي.
- يتسبب التدخل المشترك في جميع المكونات الثلاثة في إزالة 0.776 من الرفض، مع وجود 74% من التأثير فقط تحت هذا التعديل المجمع.
- يفسر مطابقة أسماء الوحدات التقليدية فقط 0.066 من التأثير الكلي، مما يتسبب في فشل الهجوم بصمت إذا طُبق بشكل ضيق.
- يحقق الأسلوب تخفيضات تتراوح بين 41 و89 نقطة مئوية عبر سبعة معايير للضرر دون تغييرات مكتشفة في القدرة.
- يبقى متبقي مركز على فئة معينة بعد التعديلات على العنف والمحتوى الجنسي والكراهية، مما يترك رفضاً قابلاً للقياس عند كل رتبة من 1 إلى 12.
تشير النتائج إلى أن محاذاة السلامة في نماذج MoE أكثر هشاشة مما كان يُعتقد سابقاً، حيث إن المكونات الحرجة للرفض مبعثرة ولا يمكن تحديدها بسهولة باستخدام طرق الفحص القياسية.