研究者らは、主要な大規模言語モデル(LLM)プロバイダーがステップバイステップの推論トレースを処理する方法におけるアーキテクチャ上の脆弱性を特定しました。プロバイダーはこれらのトレースをクライアントに対して暗号化ブロックとして返しますが、本研究では、これらのブロックが同一プロバイダーのエコシステム内において、異なるセッション、ユーザー、モデル間で完全に互換性があり交換可能であることが判明しました。
- 研究者らは、同一プロバイダーの強力なモデルから推論トレースを抽出し、保護の弱い別のモデルに注入することで平文出力を引き出す、スケーラブルなデクリプションジャルブレイクを開発しました。
- この手法はアンチディスティレーションメカニズムを回避し、Anthropic、OpenAI、Googleからプロプライエタリな推論トレースの抽出を可能にします。
- この脆弱性は大規模なプライベートデータの抽出を可能にし、公開リポジトリから収集した315,320個の推論ブロックをデコードした結果、367件のPII(個人識別情報)アーティファクトと182件の資格情報が検出されました。
- この欠陥により、モデルの最終出力がリクエストを安全に拒否した場合でも、推論プロセス内に隠された危険な情報が意図せず露呈します。
- 攻撃者はこの欠陥を利用して、暗号化ブロック内に悪意のあるペイロードを埋め込むことで不可視のプロンプトインジェクションを実行し、公開されているエージェントの展開を汚染することができます。
責任ある開示の後、著者らはクライアント側の推論を保護するための具体的な暗号学的およびシステムレベルの緩和策を提案しています。