NVIDIA 연구진의 포지션 페이퍼는 신뢰할 수 없는 데이터에 내장된 악성 지시가 위험한 행동을 유발하는 간접 프롬프트 인젝션 공격으로부터 AI 에이전트를 보호하기 위한 비전을 제시합니다. 저자들은 효과적인 방어를 위해서는 고립된 모델 수정을 넘어 포괄적인 시스템 수준 아키텍처로 나아가야 한다고 주장합니다.

  • 동적 작업과 현실적인 환경을 처리하려면 동적 재계획 및 보안 정책 업데이트가 필요합니다.
  • 컨텍스트 의존적 보안 결정은 모델이 관찰하고 결정할 수 있는 내용을 엄격히 제한하는 설계 내에서만 LLM에 의존해야 합니다.
  • 본질적으로 모호한 사례의 경우 개인화 및 인간 상호작용은 핵심 설계 고려사항이어야 합니다.
  • 기존 벤치마크는 그 한계로 인해 유용성과 보안에 대한 잘못된 안도감을 조성합니다.

시스템 수준 방어는 규칙 기반 및 모델 기반 검사를 통합하여 에이전트 시스템의 구조적 골격 역할을 하며, 견고성에 대한 보다 표적화된 연구를 가능하게 합니다.