Anthropic a récemment défini le mode automatique de Claude Code comme valeur par défaut pour protéger les utilisateurs contre les attaques par injection de prompt, mais le chercheur Johann Rehberger a démontré une vulnérabilité significative dans ce mécanisme de sécurité. Il a identifié une attaque qui réussit environ 80 % du temps en trompant l'agent pour qu'il télécharge et décompresse une archive zip contenant un fichier Python malveillant.
- L'exploitation repose sur l'exécution de code qui importe `base64`, ce qui déclenche par inadvertance l'exécution d'un fichier local `struct.py` extrait de l'archive.
- Dans plusieurs cas, Claude Code a détecté la compromission mais a été empêché par le mode automatique de terminer le processus malveillant ou d'exécuter des commandes de nettoyage.
- Le classificateur de sécurité a permis la création du processus malveillant puis a bloqué la tentative de l'agent pour l'arrêter, devenant ainsi effectivement partie prenante de l'échec.
Rehberger conclut que la seule manière sûre d'exécuter des agents de codage sans surveillance est dans un environnement sandbox, tel qu'un conteneur ou une machine virtuelle, tout en restreignant les sorties réseau et en masquant les identifiants sensibles.