स्वतंत्र AI सुरक्षा शोधकर्ता कृष्णकांत रेड्डी येदुगुरु "RedSOC — LLM-एकीकृत सुरक्षा संचालन केंद्रों के लिए एक विरोधाभासी मूल्यांकन फ्रेमवर्क" शीर्षक वाले पेपर के लिए arXiv पर cs.CR श्रेणी के लिए सहमति की मांग कर रहे हैं।

अध्ययन में प्रमुख निष्कर्ष प्रस्तुत किए गए हैं, जिनमें अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन के लिए 100% हमला सफलता दर (ASR) और कॉर्पस विषाक्तकरण के लिए 80% ASR शामिल है। इसके अतिरिक्त, प्रस्तावित पता लगाने वाली परत ने मॉडल के आंतरिक हिस्सों की आवश्यकता के बिना 15 परिदृश्यों और 10 स्वतंत्र रनों में 100% पता लगाने की उपलब्धि हासिल की।

लेखक arXiv पर समीक्षा प्रक्रिया को सुगम बनाने के लिए एक सहमति कोड (3RCVLY) प्रदान करते हैं।