Anthropic은 최근 프롬프트 인젝션 공격으로부터 사용자를 보호하기 위해 Claude Code의 자동 모드를 기본값으로 설정했지만, 연구자 Johann Rehberger는 이 안전 메커니즘에 상당한 취약점이 있음을 입증했습니다. 그는 에이전트를 속여 악성 Python 파일이 포함된 zip 아카이브를 다운로드하고 압축 해제하도록 유도하여 약 80%의 성공률을 보이는 공격을 발견했습니다.
- 이 익스플로잇은 `base64`를 가져오는 코드를 실행하는 데 의존하며, 이는 아카이브에서 추출된 로컬 `struct.py` 파일의 실행을 우연히 트리거합니다.
- 여러 사례에서 Claude Code는 침해 사실을 감지했지만, Auto Mode가 악성 프로세스 종료 또는 정리 명령 수행을 방지했습니다.
- 안전 분류기는 악성 프로세스 생성은 허용했지만 에이전트가 이를 중지하려는 시도는 차단하여 결과적으로 실패의 일부가 되었습니다.
Rehberger는 비감독 코딩 에이전트를 실행하는 유일한 안전한 방법은 컨테이너나 VM과 같은 샌드박스 환경 내에서 네트워크 아웃그레스를 제한하고 민감한 자격 증명을 숨기는 것이라고 결론지었습니다.