भारत के पश्चिम बंगाल में स्थित एक स्वतंत्र AI सुरक्षा शोधकर्ता क्रिप्टोग्राफी और सुरक्षा श्रेणी के तहत arXiv पर एक पेपर जमा करने के लिए व्यक्तिगत प्रमाणपत्र की मांग कर रहे हैं। पेपर में बड़े भाषा मॉडल की सुरक्षा व्यवहार में धीरे-धीरे होने वाले, बहु-चरण संवाद विचलन का एक केस स्टडी दस्तावेजित किया गया है, जहां निरंतर दार्शनिक ढांचा घोषित दिशानिर्देशों के असंगत आउटपुट से सहसंबंधित है।
यह कार्य LogiBreak या H-CoT जैसे सिंगल-प्रॉम्प्ट हमलों के बजाय संचयी संवाद दबाव पर केंद्रित है। इसे स्पष्ट रूप से एक परिकल्पना-जनरेटिंग केस स्टडी के रूप में प्रस्तुत किया गया है जिसमें स्वीकृत सीमाएं हैं, जिनमें नियंत्रित प्रोटोकॉल या सांख्यिकीय विश्लेषण के बिना एकमात्र अवलोकनकर्ता होना शामिल है। निष्कर्षों को आधिकारिक तौर पर Google के VRP, CERT-In भारत और CISA USA को संप्रेषित किया गया है।
संस्थागत ईमेल या पूर्व में स्वीकृत arXiv पेपर की कमी के कारण लेखक स्वचालित प्रमाणपत्र के लिए पात्र नहीं हैं, जिसके परिणामस्वरूप सहायता के लिए यह सार्वजनिक अनुरोध आवश्यक हो गया है।