AbdaullahAG dan Somia Abufakher telah merilis SemGuard, sebuah gerbang keamanan semantik sumber terbuka berlapis empat yang dirancang untuk melindungi model bahasa besar dari injeksi prompt, jailbreak, dan kebocoran privasi dalam bahasa Arab, Arabizi, dan Inggris.

  • Sistem ini memiliki pipa bertingkat yang mencakup normalisasi Unicode, filter pemeriksaan cepat regex sub-milidetik, dan pengklasifikasi semantik tiga-jangkar menggunakan embedding multilingual-e5-large.
  • SemGuard mencapai skor F1 sebesar 0.992 pada serangan prompt bahasa Arab, mengungguli baseline seperti ProtectAI dengan +21.3 poin F1 sambil mempertahankan latensi sub-milidetik.
  • Para penulis juga merilis Dataset Benchmark SemGuard yang berisi 807 contoh yang divalidasi oleh manusia dan LLM di tujuh kategori ancaman.
  • Temuan kunci dari dataset ini adalah bahwa model bahasa besar terkini tidak sepakat sebanyak 98.2% saat membedakan antara impersonasi berbahaya dan roleplay yang bermanfaat dalam bahasa Arab.

SemGuard menyediakan alternatif yang dapat dijelaskan untuk pengklasifikasi kotak hitam dengan menghasilkan laporan JSON terperinci tentang permintaan yang diblokir atau diizinkan, mengatasi kesenjangan keamanan untuk bahasa yang kurang memiliki sumber daya.