AbdaullahAGとSomia Abufakherは、アラビア語、Arabizi、英語におけるプロンプトインジェクション、ジャイルブレイク、プライバシー漏洩から大規模言語モデルを保護するために設計されたオープンソースの4層型意味セキュリティゲートウェイであるSemGuardをリリースしました。

  • システムには、Unicode正規化、サブミリ秒の正規表現高速チェックフィルタ、および多言語-e5-large埋め込みを用いた三重アンカー意味分類器を含むカスケードパイプラインが特徴です。
  • SemGuardはアラビア語のプロンプト攻撃において0.992のF1スコアを達成し、ProtectAIなどのベースラインをF1ポイントで+21.3上回りながら、サブミリ秒のレイテンシを維持しています。
  • 著者らはまた、7つの脅威カテゴリにわたる807件の人間およびLLM検証済み例を含むSemGuardベンチマークデータセットもリリースしました。
  • データセットからの重要な発見として、アラビア語において有害ななりすましと無害なロールプレイを区別する際、最先端のLLMが98.2%の確率で意見が一致しないことが挙げられます。

SemGuardは、ブロックされたまたは許可されたリクエストに関する詳細なJSONレポートを出力することで、ブラックボックス分類器に対する説明可能な代替手段を提供し、リソース不足の言語におけるセキュリティギャップに対応しています。