研究者らは、間接的なプロンプトインジェクション攻撃に対して大規模言語モデル(LLM)の安全なアライメントを改善するために設計されたモデルレベルのソリューションであるReasAlignを導入した。このアプローチは、ユーザーのクエリを分析し矛盾する指示を検出するために構造化された推論ステップを組み込み、ユーザーの意図したタスクの継続性を確保する。
- ReasAlignは、推論ステップにスコアを付け最適な経路を選択するために、環境設定最適化済みジャッジモデルを用いたテスト時のスケーリングメカニズムを採用している。
- CyberSecEval2ベンチマークにおいて、94.6%のユーティリティとわずか3.6%のアタックスクセス率(ASR)を達成した。
- このパフォーマンスは、同じタスクで56.4%のユーティリティと74.4%のASRを記録したMeta SecAlignを大きく上回る。
著者らは、ReasAlignがセキュリティとユーティリティの最適なトレードオフを実現することで、現実世界のエージェントシステムにおけるプロンプトインジェクション攻撃に対する堅牢で実用的な防御を確立すると述べている。