AbdaullahAG y Somia Abufakher han lanzado SemGuard, una puerta de enlace de seguridad semántica de código abierto en cuatro capas, diseñada para proteger a los grandes modelos de lenguaje (LLM) contra inyecciones de instrucciones, eludir restricciones y fugas de privacidad en árabe, Arabizi e inglés.

  • El sistema cuenta con una canalización en cascada que incluye normalización Unicode, un filtro de verificación rápida por expresiones regulares con latencia inferior a un milisegundo y un clasificador semántico de triple ancla que utiliza incrustaciones multilingües multilingual-e5-large.
  • SemGuard logra una puntuación F1 de 0.992 en ataques de instrucciones en árabe, superando a las líneas base como ProtectAI en +21.3 puntos F1 mientras mantiene una latencia inferior a un milisegundo.
  • Los autores también han publicado el Conjunto de Datos SemGuard Benchmark que contiene 807 ejemplos validados por humanos y LLM a través de siete categorías de amenazas.
  • Un hallazgo clave del conjunto de datos es que los grandes modelos de lenguaje (LLM) más avanzados discrepan en un 98.2 % de las veces al distinguir entre suplantación de identidad dañina y juego de roles inofensivo en árabe.

SemGuard proporciona una alternativa explicable a los clasificadores de caja negra mediante la generación de informes JSON detallados sobre las solicitudes bloqueadas o permitidas, abordando la brecha de seguridad para idiomas con menos recursos.