实验室 · Zhipu AI
media r/LocalLLaMA · 1 天前 · 1 次浏览

Anthropic 研究将 GLM-5 与高级网络能力的传播联系起来

Anthropic 发表了一篇题为《GLM-5.3 与高级网络能力的传播》的研究文章,探讨了 GLM-5 等开源模型如何被用于恶意网络活动。 文章指出,这些模型已被威胁行为者广泛采用,实际上在安全社区中起到了宣传其能力的作用。 这一分析强调了人们对先进 AI 模型双重用途性质及其放大网络威胁潜力的日益担忧。

arxiv arXiv cs.CL · 21 天前 · 33 次浏览

对GLM-5.3-Flash的单方向攻击揭示MoE模型安全对齐的脆弱性

研究人员表明,方向消融(directional ablation)这一通过从权重中投影去除单一方向来移除拒绝行为的白盒攻击,在前沿混合专家(MoE)模型(如GLM-5.3-Flash)上仍然有效。研究表明,尽管该攻击能够穿透架构,但其影响分布在注意力层、密集层和路由专家写入器之间,而非集中在某一位置。