Anthropic 发表了一篇题为《GLM-5.3 与高级网络能力的传播》的研究文章,探讨了 GLM-5 等开源模型如何被用于恶意网络活动。 文章指出,这些模型已被威胁行为者广泛采用,实际上在安全社区中起到了宣传其能力的作用。 这一分析强调了人们对先进 AI 模型双重用途性质及其放大网络威胁潜力的日益担忧。
media
r/LocalLLaMA
·
1 天前
·
open_models
Anthropic 研究将 GLM-5 与高级网络能力的传播联系起来
译自 English → 中文
相关文章
blog
Simon Willison
·
23 小时前
·
2 次浏览
Anthropic发现GLM-5.3在网络红队测试中实现完全控制流劫持
Anthropic的Frontier Red Team在内部Binary Exploitation基准测试的100项任务上评估了中国模型GLM-5.3,发现其在4%的试验中能够开发完全的控制流劫持。
media
r/LocalLLaMA
·
1 天前
·
15 次浏览
Anthropic分析GLM-5.3及高级网络能力的传播
Anthropic发表了一篇研究文章,考察了GLM-5.3及其在传播高级网络能力中的作用。
arxiv
arXiv cs.CL
·
14 天前
·
24 次浏览
前沿模型在维基百科上的log(N)问答游戏中接受评估
一项研究对六个前沿语言模型在一个双智能体通信任务上进行了评估,其中提问方通过恰好 log2(N) 个是/否问题从 N 段维基百科段落中识别目标。实验在包含 4 到 1024 段文档的集合上运行了 408 场游戏,揭示了被测模型之间显著的性能差异。
media
TLDR AI
·
34 天前
·
66 次浏览
GLM-5.3 Flash在编程基准测试中接近Claude Opus 4.8
Z.ai透露,此前匿名测试的模型ox-alpha是GLM-5.3-Flash,这是一个拥有320B参数、18B激活参数的混合专家(MoE)模型。
media
Together AI Blog
·
40 天前
·
77 次浏览
GLM-5.3 在 DeepSWE 上以五分之一的成本达到与 Claude Fable 5 相当的准确率
GLM-5.3 与 Claude Fable 5 在 DeepSWE 基准上的对比显示,尽管两个模型的首次尝试准确率几乎相同(69.0% vs 69.7%),但 GLM-5.3 的成本效益显著更高,且在多次尝试场景中表现更佳。