一篇新论文表明,来自 Claude、GPT 和 Gemini 等前沿模型的加密推理块可以被解码并重放,以提取隐藏的思维链数据。作者展示了如何将这些签名数据块传输给较弱的模型或不同的会话,从而转录底层思维,有效地绕过了提供商的混淆措施。
- 对约 7,000 条公开轨迹的扫描揭示了敏感泄露数据,包括 62 个唯一的 API 密钥、33 个电子邮件地址和 33 个密码,这些数据仅隐藏在推理块中。
- 该技术涉及获取合法的加密块,将其重放到同一提供商的不同请求或较弱的模型中,并使用特定的提示来强制转录附加的推理内容。
- 论文详细说明了针对 Claude(重放至 Haiku 4.5)、GPT(注入带有分块续写的加密内容)和 Gemini(附加思维签名)的具体方法。
- 该漏洞引发了严重的隐私担忧,因为共享轨迹可能泄露个人数据,并且由于解码后的思维简短或碎片化,使得对齐监控变得复杂。
该论文已负责任地披露,且多个漏洞已被修复,但这些发现突显了前沿实验室在处理和保护内部推理流程方面存在的持续风险。