Anthropic menjadikan mode otomatis sebagai pengaturan default untuk sesi baru di Claude Code untuk paket Pro, Max, dan Team mulai 14 Agustus. Perubahan ini mencerminkan kepercayaan perusahaan pada kemampuan fitur untuk mengurangi risiko seperti injeksi prompt dan eksfiltrasi data secara lebih efektif daripada tinjauan manusia.
- Sebuah studi terkontrol terhadap 1.053 penguji berbayar menemukan bahwa mode otomatis akan memblokir 89% tindakan berbahaya, dibandingkan hanya 13,6% yang ditolak oleh manusia.
- Evaluasi oleh Trajectory Labs menguji 720 skenario injeksi prompt tidak langsung terhadap Claude Fable 5, Opus 5, dan Sonnet 5 yang menjalankan mode otomatis.
Tidak satu pun dari 720 upaya serangan berhasil melawan model Claude yang ditentukan selama evaluasi pihak ketiga.
Anthropic menganggap pergeseran ini penting karena kelelahan konfirmasi menyebabkan perilaku tidak aman pada peninjau manusia, sedangkan mode otomatis secara signifikan mengurangi paparan terhadap instruksi jahat.