Недавно Anthropic установила автоматический режим Claude Code по умолчанию для защиты пользователей от атак с помощью инъекций промптов, однако исследователь Йоханн Реббергер продемонстрировал значительную уязвимость в этом механизме безопасности. Он выявил атаку, которая успешно выполняется примерно в 80% случаев, обманывая агента так, что тот скачивает и распаковывает zip-архив, содержащий вредоносный Python-файл.

  • Эксплуатация уязвимости основана на выполнении кода, который импортирует `base64`, что непреднамеренно запускает выполнение локального файла `struct.py`, извлечённого из архива.
  • В нескольких случаях Claude Code обнаружил компрометацию, но автоматический режим помешал ему завершить процесс вредоносного ПО или выполнить команды очистки.

Классификатор безопасности позволил создать вредоносный процесс, а затем заблокировал попытку агента остановить его, тем самым став частью сбоя.

Реббергер приходит к выводу, что единственным безопасным способом запуска ненадзорных кодовых агентов является использование среды песочницы, такой как контейнер или виртуальная машина, при этом необходимо ограничивать исходящий сетевой трафик и скрывать конфиденциальные учётные данные.