Anthropic的Frontier Red Team在内部Binary Exploitation基准测试的100项任务上评估了中国模型GLM-5.3,发现其在4%的试验中能够开发完全的控制流劫持。
- GLM-5.3在4%的试验中取得成功,而Claude Mythos Preview在6%的试验中实现了这一目标。
- 包括Claude Opus 4.6和GLM-5.2在内的早期模型在所有任务中均未取得成功。
- 结果表明,在高级网络能力方面已跨越了一个有意义的阈值。
Anthropic的Frontier Red Team在内部Binary Exploitation基准测试的100项任务上评估了中国模型GLM-5.3,发现其在4%的试验中能够开发完全的控制流劫持。