शोधकर्ताओं ने ReasAlign पेश किया है, जो एक मॉडल-स्तर का समाधान है जिसे Large Language Models (LLMs) में अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन हमलों के खिलाफ सुरक्षा संरेखण को बेहतर बनाने के लिए डिज़ाइन किया गया है। इस दृष्टिकोण में उपयोगकर्ता क्वेरी का विश्लेषण करने और विरोधाभासी निर्देशों का पता लगाने के लिए संरचित तर्क चरण शामिल हैं, जिससे उपयोगकर्ता की इच्छित कार्यों की निरंतरता सुनिश्चित होती है।

  • ReasAlign में प्राथमिकता-अनुकूलित जज मॉडल के साथ परीक्षण-समय स्केलिंग तंत्र शामिल है जो तर्क चरणों को स्कोर करता है और सर्वोत्तम ट्राजेक्टरी का चयन करता है।
  • CyberSecEval2 बेंचमार्क पर, यह 94.6% उपयोगिता और केवल 3.6% हमल सफलता दर (ASR) प्राप्त करता है।
  • इस प्रदर्शन ने Meta SecAlign को काफी पीछे छोड़ दिया, जिसने समान कार्यों पर 56.4% उपयोगिता और 74.4% ASर दर्ज किया था।

लेखकों का कहना है कि ReasAlign सुरक्षा और उपयोगिता के बीच सर्वोत्तम संतुलन हासिल करके, वास्तविक-दुनिया एजेंटिक सिस्टम में प्रॉम्प्ट इंजेक्शन हमलों के खिलाफ एक मजबूत और व्यावहारिक रक्षा स्थापित करता है।