Pesquisadores identificaram uma vulnerabilidade na forma como os principais provedores de modelos de linguagem grandes manipulam os rastros de raciocínio passo a passo, que são retornados como blocos criptografados para uso no lado do cliente. Eles descobriram que esses blocos criptografados são totalmente compatíveis e intercambiáveis entre diferentes sessões, usuários e modelos dentro do ecossistema do mesmo provedor.

  • A equipe desenvolveu um jailbreak de descriptografia escalável injetando um rastro de raciocínio criptografado de um modelo capaz em um modelo mais fraco e menos protegido para forçá-lo a exibir o rastro em texto puro.
  • Este método contorna mecanismos anti-distilação, permitindo a extração de rastros de raciocínio proprietários de provedores incluindo Anthropic, OpenAI e Google.
  • A vulnerabilidade permite a extração em larga escala de dados privados; a decodificação de 315.320 blocos de raciocínio raspados de repositórios públicos revelou 367 artefatos de PII e 182 credenciais.
  • A falha revela inadvertidamente informações perigosas ocultas dentro do processo de raciocínio, mesmo quando a saída final do modelo rejeita com segurança uma solicitação maliciosa.
  • Atacantes podem usar essa falha para executar injeções de prompt invisíveis embutindo payloads maliciosos dentro de blocos criptografados para envenenar rollouts agênticos públicos.

Após a divulgação responsável, os autores propõem mitigações criptográficas e em nível de sistema concretas para proteger o raciocínio do lado do cliente.