शोधकर्ताओं ने दिखाया कि दिशात्मक अबलेशन, जो वेट्स से एक दिशा को प्रोजेक्ट करके इनकार को हटाने वाला एक व्हाइट-बॉक्स हमला है, GLM-5.3-Flash जैसे फ्रंटियर मिक्चर-ऑफ-एक्सपर्ट्स (MoE) मॉडल्स पर प्रभावी बना हुआ है। अध्ययन दर्शाता है कि जबकि हमला आर्किटेक्चर के बावजूद टिक जाता है, इसके प्रभाव एटेंशन, डेनस और रूटेड-एक्सपर्ट राइटर्स में फैले हुए हैं, न कि किसी एक स्थान पर केंद्रित।

  • एटेंशन, डेनस और रूटेड-एक्सपर्ट राइटर्स को अलग-अलग एडिट करने से क्रमशः 0.039, 0.016 और 0.148 इनकार हटता है।
  • तीनों घटकों पर संयुक्त हस्तक्षेप 0.776 इनकार को हटाता है, जिसमें से 74% प्रभाव केवल इस संयुक्त एडिट के तहत मौजूद होता है।
  • पारंपरिक मॉड्यूल-नाम मिलान कुल प्रभाव का केवल 0.066 हिस्सा समझाता है, जिससे हमला संकीर्ण रूप से लागू होने पर चुपचाप विफल हो जाता है।
  • इस विधि ने क्षमता में कोई पता चले बदलाव के बिना सात हानिकारक बेंचमार्क्स पर 41-89 प्रतिशत अंक की कमी हासिल की।
  • हिंसा, यौन सामग्री और नफरत पर एडिट्स के बाद एक श्रेणी-केंद्रित अवशेष बचा रहता है, जो रैंक 1 से 12 तक हर स्तर पर मापने योग्य इनकार छोड़ता है।

निष्कर्ष संकेत करते हैं कि MoE मॉडल्स में सुरक्षा एलाइनमेंट पहले से सोचे जाने से अधिक नाजुक है, क्योंकि इनकार के लिए महत्वपूर्ण घटक बिखरे हुए हैं और मान्य निरीक्षण विधियों द्वारा आसानी से पहचाने नहीं जा सकते।