NVIDIAの研究員によるポジションペーパーは、信頼できないデータに埋め込まれた悪意のある指示が危険なアクションを引き起こす間接プロンプトインジェクション攻撃からAIエージェントを守るためのビジョンを概説しています。著者たちは、効果的な防御には孤立したモデルの修正を超え、包括的なシステムレベルのアーキテクチャへの移行が必要であると主張しています。

  • 動的なタスクや現実的な環境を処理するには、動的な再計画とセキュリティポリシーの更新が必要です。
  • コンテキスト依存のセキュリティ判断は、モデルが観察および決定できる内容を厳格に制限する設計内でのみLLMに依存すべきです。
  • 本質的に曖昧なケースには、パーソナライゼーションと人間との対話が設計上の中心的考慮事項である必要があります。
  • 既存のベンチマークは、その制約のため、有用性とセキュリティに対する誤った安心感を生み出すことが多いです。

システムレベルの防御は、ルールベースおよびモデルベースのチェックを統合することで、エージェントシステムの構造的な骨格として機能し、堅牢性に関するより焦点を絞った研究を可能にします。