一项研究对“脆弱标记”进行了刻画,这些是开放权重语言模型中的词汇条目,它们在孤立时能够成功复制,但在嵌入周围文本时会表现出错误。该研究强调,标准隔离测试并不能保证字面身份的保留,因为标记在序列中可能会被删除、替换或截断。

  • 使用固定在随机常见词序列(长度各异)中插入的固定标记ID,测试了来自 Qwen 和 OLMo 系列的八个开放权重模型。
  • 发现基于概率的筛选将 0.4% 至 10.9% 的通过隔离探针的标记标记为在至少 10% 的测试上下文中易受攻击。
  • 展示了包括删除、替换、截断和翻译在内的具体失败模式,即使在高密度的输出分布下,某些错误仍然发生。
  • 评估了几何信号,发现输入和输出嵌入的接近度在七个模型上识别这些标记时达到了 0.744 至 0.881 的 AUROC。
  • 表明在指令和模拟工具使用任务中,选定的脆弱候选者比稳定对照组更少被保留。

这些发现促使人们采用上下文验证协议,主张通过隔离探针不应被视为字面可靠性的通用证书。