新しい論文は、Claude、GPT、Geminiなどの最先端モデルからの暗号化された推論ブロックを解凍・再生することで、隠された思考連鎖データを抽出できることを実証している。著者らは、これらの署名付きデータブロックをより弱いモデルや異なるセッションへ転送し、基盤となる思考を書き起こす方法を明らかにし、提供元の難読化対策を効果的に回避した。

  • 約7,000件の公開トレースの調査により、62個の一意なAPIキー、33件のメールアドレス、および推論ブロック内にのみ隠された33件のパスワードを含む機密性の高い漏洩データが明らかになった。
  • この手法は、正当な暗号化ブロックを取得し、同じプロバイダーからの別のリクエストやより弱いモデルへ再生し、特定のプロンプトを使用して添付された推論の書き起こしを強制することを含む。
  • Claude(Haiku 4.5への再生)、GPT(チャンク化された継続処理とともに暗号化コンテンツを注入)、Gemini(思考署名の添付)に対する具体的な手法が詳述されている。
  • この脆弱性は、共有トレースにより個人データが漏洩する可能性があり、解読された思考が簡潔または断片的であるためアライメント監視を複雑にするなど、重大なプライバシー懸念を引き起こす。

論文は責任を持って開示され、いくつかの脆弱性はすでに修正されているが、この発見は最先端ラボが内部推論プロセスをどのように扱い、保護するかにおける持続的なリスクを浮き彫りにしている。