AbdaullahAG и Somia Abufakher выпустили SemGuard, открытый исходный код многослойного семантического шлюза безопасности, предназначенного для защиты больших языковых моделей от инъекций промптов, обходов ограничений (jailbreaks) и утечек конфиденциальной информации на арабском языке, Arabizi и английском.

  • Система включает каскадный конвейер, состоящий из нормализации Unicode, быстрого фильтра регулярных выражений с задержкой менее миллисекунды и тройного якорного семантического классификатора, использующего multilingual-e5-large встраивания.
  • SemGuard достигает F1-меры 0.992 на атаках арабских промптов, превосходя базовые модели, такие как ProtectAI, на +21.3 пункта F1 при сохранении задержки менее миллисекунды.
  • Авторы также выпустили набор данных SemGuard Benchmark Dataset, содержащий 807 примеров, проверенных людьми и LLM, по семи категориям угроз.
  • Ключевым выводом из набора данных является то, что современные LLM не согласны в 98.2% случаев при различии между вредоносной имперсонацией и безобидным ролевым игрой на арабском языке.

SemGuard предоставляет объяснимую альтернативу черным ящикам классификаторов, выводя подробные JSON-отчеты о заблокированных или разрешенных запросах, закрывая пробел в безопасности для языков с недостаточными ресурсами.