独立したAIセキュリティ研究者Krishnakaanth Reddy Yeduguruは、「RedSOC — LLM統合セキュリティ運用センターのための敵対的評価フレームワーク」と題された論文に対して、arXivのcs.CRカテゴリの推薦を申請しています。
この研究では、間接プロンプトインジェクションに対する攻撃成功率(ASR)が100%、コーパスポイズニングに対するASRが80%という主要な知見を示しています。さらに、提案された検出レイヤーは、モデル内部へのアクセスを必要とせずに、15のシナリオと10回の独立した実行で100%の検出率を達成しました。
著者はarXivでの審査プロセスを促進するために、推薦コード(3RCVLY)を提供しています。