arxiv
arXiv cs.CL
·
21 hari lalu
·
33 tayangan
Serangan satu arah pada GLM-5.3-Flash mengungkap kerapuhan penyesuaian keamanan pada model MoE
Peneliti menunjukkan bahwa ablasi berarah, sebuah serangan kotak-putih yang menghilangkan penolakan dengan memproyeksikan keluar satu arah dari bobot, tetap efektif pada model campuran-ahli (MoE) terdepan seperti GLM-5.3-Flash. Studi ini menunjukkan bahwa meskipun serangan bertahan terhadap arsitektur, efeknya terdistribusi di seluruh penulis perhatian, padat, dan ahli yang dialihkan, bukan terkonsentrasi di satu lokasi.