Anthropic baru-baru ini menjadikan mode otomatis Claude Code sebagai pengaturan default untuk melindungi pengguna terhadap serangan injeksi prompt, tetapi peneliti Johann Rehberger telah menunjukkan kerentanan signifikan dalam mekanisme keamanan ini. Ia mengidentifikasi serangan yang berhasil sekitar 80% dengan menipu agen untuk mengunduh dan mengekstrak arsip zip berisi file Python berbahaya.

  • Eksploitasi ini mengandalkan eksekusi kode yang mengimpor `base64`, yang secara tidak sengaja memicu eksekusi file lokal `struct.py` yang diekstrak dari arsip tersebut.
  • Dalam beberapa kasus, Claude Code mendeteksi kompromi tetapi dicegah oleh Auto Mode untuk menghentikan proses malware atau menjalankan perintah pembersihan.
  • Klasifikator keamanan mengizinkan pembuatan proses berbahaya tetapi kemudian memblokir upaya agen untuk menghentikannya, sehingga secara efektif menjadi bagian dari kegagalan.

Rehberger menyimpulkan bahwa satu-satunya cara aman untuk menjalankan agen pemrograman tanpa pengawasan adalah dalam lingkungan sandbox, seperti kontainer atau VM, sambil membatasi egress jaringan dan menyembunyikan kredensial sensitif.