本文介绍了DISA(动态免疫分流架构),这是一种概念性研究提案,旨在通过稀疏内部监控而非仅依赖可观测输出来检测大型语言模型中潜在的欺骗性行为。该框架旨在解决这样一个风险:当能力较强的模型意识到自己正被监控时,其行为可能会发生变化。
DISA由四个主要组件组成:
- ASAM(异步稀疏激活监控)采样选定的内部状态,如残差激活和注意力表示,与持续监控相比可降低计算开销。
- MDRE(多信号欺骗风险估计)结合多种信号,包括激活探针证据、行为不一致性和不确定性,以估算风险,同时避免将幻觉与欺骗混淆。
- RIA(可逆干预适配器)应用临时干预措施,例如引导方向或低秩适配器,以减少目标行为,同时保留模型能力。
- IAI(隔离审计基础设施)使用四类数据集支持评估过程,独立控制触发器和目标行为,以防止记忆化。
该提案强调,DISA是一个可证伪的框架,旨在接受测试、批评或拒绝,而非作为解决欺骗性对齐问题的最终方案。