Anthropic은 8월 14일부터 Pro, Max 및 Team 플랜의 Claude Code 새 세션에 대해 자동 모드를 기본 설정으로 변경합니다. 이 변경은 프롬프트 인젝션 및 데이터 유출과 같은 위험을 인간 검토보다 더 효과적으로 완화할 수 있는 기능에 대한 회사의 신뢰를 반영합니다.
- 1,053명의 유료 테스터에 대한 통제된 연구에서 자동 모드가 해로운 작업의 89%를 차단했을 것으로 나타났으며, 인간이 거부한 비율은 13.6%에 불과했습니다.
- Trajectory Labs의 평가에서는 Claude Fable 5, Opus 5 및 Sonnet 5에서 자동 모드를 실행하며 720개의 간접 프롬프트 인젝션 시나리오를 테스트했습니다.
제3자 평가 동안 지정된 Claude 모델에 대한 720회의 공격 시도 중 성공한 사례는 없었습니다.
Anthropic은 이 변경을 중요하게 생각합니다. 확인 피로가 인간 검토자의 안전하지 않은 행동으로 이어지는 반면, 자동 모드는 악성 지시에 대한 노출을 크게 줄이기 때문입니다.