英伟达研究人员的一篇立场论文概述了保护AI代理免受间接提示注入攻击的愿景,其中嵌入在不可信数据中的恶意指令会触发危险操作。作者认为,有效的防御需要超越孤立的模型修复,转向全面的系统级架构。
- 动态重新规划和安全策略更新对于处理动态任务和真实环境是必要的。
- 上下文相关的安全决策应仅在严格限制模型可观察和决策内容的架构内依赖LLM。
- 个性化和人类交互必须是本质上模糊案例的核心设计考量。
- 现有的基准测试往往因其局限性而制造出虚假的效用和安全感觉。
系统级防御通过整合基于规则和基于模型的检查,作为代理系统的结构骨架,使针对鲁棒性的研究更加具有针对性。