ある論文は、Anthropic、OpenAI、Googleが返す暗号化されたchain-of-thoughtブロックが平文で抽出可能であることを実証した。著者らは、同じファミリー内のモデルが暗号鍵を共有している脆弱性を悪用し、推論トレースをより弱い兄弟モデルにリプレイさせた。
- より強力なモデルからの暗号化された推論ブロックをClaude Haiku 4.5のような弱いモデルに供給することで、攻撃者はモデルを脱獄させ、生で暗号化されていないコンテンツを出力させた。
- この攻撃は、カスタムタグ内で添付された推論をそのまま転写するようモデルに指示するなど、特定のプロンプトインジェクション手法を利用した。
- モデルは自身の推論トレースを絶対的なものとして扱い、これらのリプレイされたチャンク内に埋め込まれた指示に従いやすかった。
論文はこの手法が人間への利用を意図していない内部推論トークンを明らかにし、プロンプトインジェクションの新たな変種を発見したことを強調している。しかし、著者らはすべてのモデルプロバイダーが報告を認識し、その後脆弱性を修正したと述べている。