一篇论文表明,Anthropic、OpenAI和Google返回的加密思维链块可以被提取为明文。作者利用了一个漏洞:同一系列内的模型共享加密密钥,从而允许他们将推理轨迹重放至较弱的子模型中。

  • 通过将来自较强模型的加密推理块输入到Claude Haiku 4.5等较弱模型中,攻击者可以越狱该模型以输出原始、未加密的内容。
  • 该攻击利用了特定的提示注入技术,例如指示模型在自定义标签内逐字转录附带的推理过程。
  • 模型将其自身的推理轨迹视为神圣不可侵犯,因此极易遵循这些重放块中嵌入的指令。

该论文强调,此方法揭示了本不打算供人类消费的推理标记,并揭示了一种新型提示注入变体。然而,作者指出,所有模型提供商均确认了该报告并随后修补了该漏洞。