AbdaullahAG et Somia Abufakher ont publié SemGuard, une passerelle de sécurité sémantique open-source à quatre couches conçue pour protéger les grands modèles de langage contre les injections d'invite, les contournements de sécurité et les fuites de confidentialité en arabe, Arabizi et anglais.

  • Le système comprend un pipeline en cascade incluant la normalisation Unicode, un filtre rapide par expression régulière sous la milliseconde, et un classificateur sémantique à triple ancre utilisant des embeddings multilingues-e5-large.
  • SemGuard atteint un score F1 de 0.992 sur les attaques d'invite en arabe, surpassant les références comme ProtectAI de +21.3 points F1 tout en maintenant une latence sous la milliseconde.
  • Les auteurs ont également publié le jeu de données SemGuard Benchmark Dataset contenant 807 exemples validés par des humains et des LLM à travers sept catégories de menaces.
  • Une découverte clé du jeu de données est que les LLMs de pointe sont en désaccord 98,2 % du temps lorsqu'ils distinguent une usurpation d'identité nuisible d'un jeu de rôle bénin en arabe.

SemGuard fournit une alternative explicable aux classificateurs à boîte noire en générant des rapports JSON détaillés sur les requêtes bloquées ou autorisées, comblant ainsi le manque de sécurité pour les langues sous-dotées en ressources.