أصدر عبد الله عباد وسامية أبو فخير بوابة أمان دلالية مفتوحة المصدر ذات أربع طبقات تُعرف باسم SemGuard، مصممة لحماية النماذج اللغوية الكبيرة من حقن الأوامر، وكسر القيود الأمنية، وتسرب الخصوصية في العربية والعربي باللاتينية والإنجليزية.

  • يتميز النظام بخط أنابيب متسلسل يتضمن تطبيع يونيكود، وفحصًا سريعًا عبر تعبيرات منتظمة يعمل في أقل من جزء من الألف من الثانية، ومصنّفًا دلاليًا ذا ثلاث مراسي يستخدم تضمينات multilingual-e5-large.
  • يحقق SemGuard درجة F1 تبلغ 0.992 على هجمات الأوامر بالعربية، متفوقًا على الأسس المرجعية مثل ProtectAI بمقدار +21.3 نقطة في درجة F1 مع الحفاظ على زمن استجابة أقل من جزء من الألف من الثانية.
  • أصدر المؤلفون أيضًا مجموعة بيانات SemGuard Benchmark Dataset التي تحتوي على 807 مثالًا تم التحقق منها بشريًا ومن قبل نماذج لغوية كبيرة عبر سبع فئات للتهديدات.
  • وكشف تحليل المجموعة عن أن أحدث النماذج اللغوية الكبيرة تتفق بنسبة 98.2% فقط عند التمييز بين التنكر الضار ولعب الأدوار البريء في العربية.

يوفر SemGuard بديلاً قابلاً للتفسير للمصنّفات الصندوق الأسود من خلال إخراج تقارير JSON مفصلة حول الطلبات المحظورة أو المسموح بها، مما يعالج فجوة الأمان للغات ذات الموارد المحدودة.