Sebuah makalah posisi oleh peneliti NVIDIA menguraikan visi untuk mengamankan agen AI dari serangan injeksi prompt tidak langsung, di mana instruksi berbahaya yang tertanam dalam data yang tidak tepercaya memicu tindakan berbahaya. Penulis berargumen bahwa pertahanan yang efektif memerlukan peralihan dari perbaikan model yang terisolasi ke arsitektur tingkat sistem yang komprehensif.

  • Perencanaan ulang dinamis dan pembaruan kebijakan keamanan diperlukan untuk menangani tugas-tugas dinamis dan lingkungan yang realistis.
  • Keputusan keamanan yang bergantung pada konteks harus mengandalkan LLM hanya dalam desain yang secara ketat membatasi apa yang dapat diamati dan diputuskan oleh model.
  • Personalisasi dan interaksi manusia harus menjadi pertimbangan desain inti untuk kasus-kasus yang secara inheren ambigu.
  • Benchmark yang ada sering kali menciptakan rasa utilitas dan keamanan palsu karena keterbatasannya.

Pertahanan tingkat sistem berfungsi sebagai kerangka struktural untuk sistem agentic dengan mengintegrasikan pemeriksaan berbasis aturan dan model, memungkinkan penelitian yang lebih terfokus pada ketangguhan.