Um artigo demonstra que blocos de cadeia de pensamento criptografados retornados pela Anthropic, OpenAI e Google podem ser extraídos em texto simples. Os autores exploraram uma vulnerabilidade onde modelos dentro da mesma família compartilhavam chaves de criptografia, permitindo que eles retransmitissem os rastros para modelos irmãos mais fracos.

  • Ao alimentar blocos de raciocínio criptografados de modelos mais fortes em modelos mais fracos como o Claude Haiku 4.5, os atacantes podiam fazer jailbreak no modelo para exibir o conteúdo bruto e não criptografado.
  • O ataque utilizou técnicas específicas de injeção de prompt, como instruir o modelo a transcrever o raciocínio anexado literalmente dentro de tags personalizadas.
  • Os modelos tratavam seus próprios rastros de raciocínio como sagrados, tornando-os altamente suscetíveis a seguir instruções embutidas nesses blocos retransmitidos.

O artigo destaca que esse método revela tokens de raciocínio interno nunca destinados ao consumo humano e descobre uma variante novel de injeção de prompt. No entanto, os autores observam que todos os provedores de modelos reconheceram o relatório e posteriormente corrigiram a vulnerabilidade.