AbdaullahAGとSomia Abufakherは、アラビア語、Arabizi、英語におけるプロンプトインジェクション、ジャイルブレイク、プライバシー漏洩から大規模言語モデルを保護するために設計されたオープンソースの4層型意味セキュリティゲートウェイであるSemGuardをリリースしました。
- システムには、Unicode正規化、サブミリ秒の正規表現高速チェックフィルタ、および多言語-e5-large埋め込みを用いた三重アンカー意味分類器を含むカスケードパイプラインが特徴です。
- SemGuardはアラビア語のプロンプト攻撃において0.992のF1スコアを達成し、ProtectAIなどのベースラインをF1ポイントで+21.3上回りながら、サブミリ秒のレイテンシを維持しています。
- 著者らはまた、7つの脅威カテゴリにわたる807件の人間およびLLM検証済み例を含むSemGuardベンチマークデータセットもリリースしました。
- データセットからの重要な発見として、アラビア語において有害ななりすましと無害なロールプレイを区別する際、最先端のLLMが98.2%の確率で意見が一致しないことが挙げられます。
SemGuardは、ブロックされたまたは許可されたリクエストに関する詳細なJSONレポートを出力することで、ブラックボックス分類器に対する説明可能な代替手段を提供し、リソース不足の言語におけるセキュリティギャップに対応しています。