AbdaullahAG e Somia Abufakher lançaram o SemGuard, um gateway de segurança semântico de quatro camadas de código aberto, projetado para proteger grandes modelos de linguagem contra injeções de prompt, jailbreaks e vazamentos de privacidade em árabe, Arabizi e inglês.

  • O sistema apresenta um pipeline em cascata que inclui normalização Unicode, filtro rápido de regex com latência sub-milissegundo e classificador semântico de triplo âncora usando embeddings multilingual-e5-large.
  • O SemGuard alcança pontuação F1 de 0.992 em ataques de prompt em árabe, superando baselines como o ProtectAI em +21.3 pontos F1 enquanto mantém latência sub-milissegundo.
  • Os autores também lançaram o SemGuard Benchmark Dataset contendo 807 exemplos validados por humanos e LLMs em sete categorias de ameaças.
  • Uma descoberta chave do dataset é que os LLMs state-of-the-art discordam 98,2% das vezes ao distinguir entre impersonação prejudicial e roleplay benigno em árabe.

O SemGuard oferece uma alternativa explicável aos classificadores black-box ao gerar relatórios JSON detalhados sobre solicitações bloqueadas ou permitidas, abordando a lacuna de segurança para idiomas com poucos recursos.