अब्दुल्लाह एजी और सोमिया अबुफखेर ने SemGuard जारी किया है, जो एक ओपन-सोर्स, चार-परत सेमैंटिक सुरक्षा गेटवे है जिसे अरबी, अरबिज़ी और अंग्रेजी में प्रॉम्प्ट इंजेक्शन, जेलब्रेक और गोपनीयता लीक से बड़े भाषा मॉडलों की रक्षा करने के लिए डिज़ाइन किया गया है।
- इस सिस्टम में यूनिकोड नॉर्मलाइजेशन, एक सब-मिलीसेकंड रेगेक्स फास्ट-चेक फ़िल्टर और बहुभाषिक-e5-large एम्बेडिंग्स का उपयोग करने वाला ट्रिपल-एंकर सेमैंटिक क्लासिफायर सहित एक कैस्केडेड पाइपलाइन शामिल है।
- SemGuard अरबी प्रॉम्प्ट हमलों पर 0.992 F1-स्कोर हासिल करता है, जो सब-मिलीसेकंड लेटेंसी बनाए रखते हुए ProtectAI जैसे बेलाइन्स से +21.3 F1 पॉइंट्स से बेहतर प्रदर्शन करता है।
- लेखकों ने सात खतरे की श्रेणियों में 807 मानव और LLM-सत्यापित उदाहरणों वाले SemGuard बेंचमार्क डेटासेट भी जारी किया है।
- डेटासेट से एक प्रमुख निष्कर्ष यह है कि अरबी में हानिकारक आत्मसातकरण और स्वस्थ भूमिका निर्वाह के बीच अंतर करने में शीर्ष स्तर के LLM 98.2% समय असहमत होते हैं।
SemGuard ब्लैक-बॉक्स क्लासिफायर्स के लिए एक व्याख्या योग्य विकल्प प्रदान करता है, जो प्रतिबंधित या अनुमति प्राप्त अनुरोधों पर विस्तृत JSON रिपोर्ट आउटपुट करके, कम संसाधनों वाली भाषाओं के लिए सुरक्षा अंतराल को दूर करता है।