从 8 月 14 日起,Anthropic 将 Claude Code 的 Pro、Max 和 Team 套餐的新会话默认设置为自动模式。这一变化反映了该公司对该功能在缓解提示注入和数据泄露等风险方面比人工审查更有效的信心。

  • 对 1,053 名付费测试者的受控研究发现,自动模式本可以阻止 89% 的有害操作,而人类仅拒绝了 13.6%。
  • Trajectory Labs 对 Claude Fable 5、Opus 5 和 Sonnet 5 在自动模式下运行时的 720 个间接提示注入场景进行了评估。

在第三方评估期间,针对指定 Claude 模型的 720 次攻击尝试均未成功。

Anthropic 认为这一转变很重要,因为确认疲劳会导致人工审查员出现不安全行为,而自动模式显著减少了对恶意指令的暴露。