Anthropic 正在更改 Claude Code,使 Auto 模式成为从 8 月 14 日起在 Pro、Max 和 Team 套餐上新会话的默认设置。这一转变紧随 Anthropic 内部采用以及展示针对提示注入改进安全性的新评估数据。
- 对 1,053 名付费测试者的研究发现,虽然只有 13.6% 的人类拒绝执行危险命令,但 Auto 模式本可以阻止 89% 的此类操作。
- Trajectory Labs 进行的独立评估针对运行 Auto 模式的 Claude Fable 5、Opus 5 和 Sonnet 5 测试了 720 个间接提示注入场景。
在第三方测试期间,针对指定 Claude 模型的 720 次攻击尝试均未成功。
该变更旨在通过依赖自动权限检查而非人工批准,来减轻确认疲劳并降低提示注入和数据泄露的风险。