AbdaullahAG 和 Somia Abufakher 发布了 SemGuard,这是一个开源的四层语义安全网关,旨在保护大型语言模型免受阿拉伯语、Arabizi 和英语中的提示注入、越狱和隐私泄露。

  • 该系统包含一个级联管道,包括 Unicode 规范化、亚毫秒级正则表达式快速检查过滤器以及使用 multilingual-e5-large 嵌入的三重锚点语义分类器。
  • SemGuard 在阿拉伯语提示攻击上实现了 0.992 F1 分数,比 ProtectAI 等基线高出 +21.3 F1 分,同时保持亚毫秒级延迟。
  • 作者还发布了包含 807 个人类和 LLM 验证示例的 SemGuard Benchmark Dataset,涵盖七个威胁类别。
  • 数据集的一个关键发现是,在区分阿拉伯语中的有害冒充和良性角色扮演时,最先进的 LLM 有 98.2% 的时间意见不一致。

SemGuard 通过输出关于被阻止或允许请求的详细 JSON 报告,为黑盒分类器提供了一种可解释的替代方案,解决了资源匮乏语言的安全缺口。