研究人员推出了 ReasAlign,这是一种模型级解决方案,旨在提升大型语言模型(LLM)针对间接提示注入攻击的安全对齐能力。该方法通过结构化的推理步骤来分析用户查询并检测冲突指令,从而确保用户预期任务的连续性。
- ReasAlign 采用测试时扩展机制,结合偏好优化评判模型对推理步骤进行评分并选择最佳轨迹。
- 在 CyberSecEval2 基准测试中,其效用达到 94.6%,攻击成功率(ASR)仅为 3.6%。
- 这一表现远超 Meta SecAlign,后者在相同任务中的效用为 56.4%,ASR 为 74.4%。
作者指出,ReasAlign 通过实现安全性与效用之间的最佳权衡,为现实世界智能体系统中的提示注入攻击建立了稳健且实用的防御机制。