Anthropicは8月14日より、Claude CodeのPro、Max、Teamプランの新セッションにおいて自動モードをデフォルト設定にします。この変更は、プロンプトインジェクションやデータ漏洩などのリスクを人間のレビューよりも効果的に軽減する機能への自信を反映しています。
- 1,053人の有料テスターによる制御研究では、自動モードが有害なアクションの89%をブロックしたのに対し、人間が拒否したのはわずか13.6%でした。
- Trajectory Labsによる評価では、Claude Fable 5、Opus 5、Sonnet 5で自動モードを実行しながら720の間接プロンプトインジェクションシナリオがテストされました。
第三者評価中、指定されたClaudeモデルに対する720回の攻撃試行はすべて失敗しました。
Anthropicはこの移行を重要視しています。確認疲れが人間のレビューヤーに不安全な行動を引き起こす一方で、自動モードは悪意のある指示への曝露を大幅に減少させるためです。