研究者らは、主要な大規模言語モデルプロバイダーがクライアント側で使用するために暗号化ブロックとして返すステップバイステップの推論トレースの処理方法に脆弱性を見つけた。彼らは、これらの暗号化ブロックが同じプロバイダーのエコシステム内において、異なるセッション、ユーザー、およびモデル間で完全に互換性があり交換可能であることを発見した。
- チームは、強力なモデルからの暗号化された推論トレースを、保護が不十分な弱いモデルに注入して平文で出力させることで、スケーラブルなデクリプションジャルブレイクを開発した。
- この手法はアンチディスティレーションメカニズムを回避し、Anthropic、OpenAI、Googleを含むプロバイダーから独自の推論トレースの抽出を可能にする。
- この脆弱性は大規模なプライベートデータの抽出を可能にし、公開リポジトリからスクレイピングした315,320の推論ブロックをデコードした結果、367のPIIアーティファクトと182の資格情報が検出された。
- この欠陥は、モデルの最終出力が悪意のあるリクエストを安全に拒否した場合でも、推論プロセス内に隠された危険な情報を偶発的に明らかにする。
- 攻撃者は、暗号化ブロック内に悪意のあるペイロードを埋め込んで公開のエージェント展開を汚染することで、この欠陥を使用して不可視のプロンプトインジェクションを実行できる。
責任ある開示の後、著者らはクライアント側の推論を保護するための具体的な暗号学的およびシステムレベルの緩和策を提案している。