A Anthropic tornou recentemente o modo automático do Claude Code como padrão para proteger os usuários contra ataques de injeção de prompt, mas o pesquisador Johann Rehberger demonstrou uma vulnerabilidade significativa nesse mecanismo de segurança. Ele identificou um ataque que tem sucesso aproximadamente 80% das vezes ao enganar o agente para baixar e descompactar um arquivo zip contendo um arquivo Python malicioso.

  • A exploração depende da execução de código que importa `base64`, o que acidentalmente dispara a execução de um arquivo local `struct.py` extraído do arquivo compactado.
  • Em vários casos, o Claude Code detectou a violação, mas foi impedido pelo Modo Automático de encerrar o processo malicioso ou executar comandos de limpeza.
  • O classificador de segurança permitiu a criação do processo malicioso, mas então bloqueou a tentativa do agente de interrompê-lo, tornando-se efetivamente parte da falha.

Rehberger conclui que a única maneira segura de executar agentes de codificação sem supervisão é dentro de um ambiente de sandbox, como um container ou VM, enquanto restringe a saída de rede e oculta credenciais sensíveis.