Um novo artigo demonstra que blocos de raciocínio criptografados de modelos de ponta como Claude, GPT e Gemini podem ser decodificados e reproduzidos para extrair dados ocultos de cadeia de pensamento. Os autores mostram como esses blobs assinados podem ser transferidos para modelos mais fracos ou sessões diferentes para transcrever os pensamentos subjacentes, efetivamente contornando os esforços de ofuscação dos provedores.

  • Uma varredura de aproximadamente 7.000 rastros públicos revelou dados sensíveis vazados, incluindo 62 chaves de API únicas, 33 endereços de e-mail e 33 senhas ocultas exclusivamente dentro dos blocos de raciocínio.
  • A técnica envolve obter um bloco criptografado legítimo, reproduzi-lo em uma solicitação diferente ou modelo mais fraco do mesmo provedor e usar prompts específicos para forçar a transcrição do raciocínio anexado.
  • Métodos específicos foram detalhados para Claude (reproduzindo para Haiku 4.5), GPT (injeter conteúdo criptografado com continuações em fragmentos) e Gemini (anexar assinaturas de pensamento).
  • A vulnerabilidade levanta preocupações significativas de privacidade, pois rastros compartilhados podem vazar dados pessoais e complica o monitoramento de alinhamento devido à natureza concisa ou fragmentada dos pensamentos decodificados.

O artigo foi divulgado de forma responsável, e várias vulnerabilidades já foram corrigidas, mas as descobertas destacam riscos persistentes na forma como os laboratórios de ponta lidam e protegem seus processos internos de raciocínio.