研究人员发现,主要的大语言模型提供商在处理逐步推理轨迹时存在架构漏洞。提供商将这些轨迹作为加密块返回给客户端,但研究发现这些块在提供商生态系统内的不同会话、用户和模型之间完全兼容且可互换。
- 研究人员通过将从一个强大模型注入的加密推理轨迹注入到同一提供商提供的另一个较弱且防护较少的模型中,从而开发出可扩展的解密越狱方法,以强制输出明文。
- 该方法绕过了防蒸馏机制,允许从Anthropic、OpenAI和Google提取专有推理轨迹。
- 该漏洞使得大规模私有数据提取成为可能;对从公共存储库抓取的315,320个推理块进行解码,揭示了367个个人身份信息(PII)特征和182个凭证。
- 即使模型的最终输出安全地拒绝了请求,这一缺陷也会无意中揭示推理过程中隐藏的有害信息。
- 攻击者可以利用此缺陷执行不可见的提示注入,通过在加密块中嵌入恶意负载来毒化公共智能体部署。
在负责任披露后,作者提出了具体的密码学和系统级缓解措施,以保护客户端推理。