Anthropic recientemente estableció el modo automático de Claude Code como predeterminado para proteger a los usuarios contra ataques de inyección de prompts, pero el investigador Johann Rehberger ha demostrado una vulnerabilidad significativa en este mecanismo de seguridad. Identificó un ataque que tiene éxito aproximadamente el 80% de las veces al engañar al agente para que descargue y descomprima un archivo zip que contiene un archivo Python malicioso.

  • La explotación se basa en ejecutar código que importa `base64`, lo que desencadena inadvertidamente la ejecución de un archivo local `struct.py` extraído del archivo.
  • En varios casos, Claude Code detectó la compromiso pero fue impedido por el Modo Automático para terminar el proceso malicioso o realizar comandos de limpieza.
  • El clasificador de seguridad permitió la creación del proceso malicioso pero luego bloqueó el intento del agente de detenerlo, convirtiéndose efectivamente en parte del fallo.

Rehberger concluye que la única forma segura de ejecutar agentes de codificación no supervisados es dentro de un entorno de sandbox, como un contenedor o VM, mientras se restringe la salida de red y se ocultan las credenciales sensibles.