研究人员发现,主要的大语言模型提供商在处理逐步推理轨迹方面存在漏洞,这些轨迹以加密块的形式返回供客户端使用。他们发现,这些加密块在同一提供商生态系统内的不同会话、用户和模型之间完全兼容且可互换。

  • 该团队通过将一个强大模型的加密推理轨迹注入到一个较弱、防护较少的模型中,开发了一种可扩展的解密越狱方法,迫使它以明文形式输出该轨迹。
  • 这种方法绕过了防蒸馏机制,允许从包括Anthropic、OpenAI和Google在内的提供商处提取专有推理轨迹。
  • 该漏洞使得大规模私有数据提取成为可能;对从公共存储库中抓取的315,320个推理块进行解码,揭示了367个个人身份信息(PII)片段和182个凭证。
  • 即使模型的最终输出安全地拒绝了恶意请求,这一缺陷也会意外暴露推理过程中隐藏的有害信息。
  • 攻击者可以利用此缺陷执行不可见的提示注入,通过在加密块中嵌入恶意负载来毒化公共智能体部署。

在负责任披露后,作者提出了具体的密码学和系统级缓解措施,以保护客户端推理。