تُظهر ورقة بحثية أنه يمكن استخراج كتل التفكير المتسلسل المشفرة التي تُرجعها أنثروبيك وأوبن إيه آي وجوجل كنص واضح. استغل المؤلفون ثغرةً حيث كانت النماذج داخل العائلة نفسها تشارك مفاتيح التشفير، مما مكنهم من إعادة تشغيل المسارات إلى نماذج أخفّ في القوة.
- عن طريق تغذية كتل الاستدلال المشفرة من النماذج الأقوى إلى النماذج الأضعف مثل كلاود هايكو 4.5، يمكن للمهاجمين اختراق النموذج لإخراج المحتوى الخام غير المشفر.
- استغل الهجوم تقنيات حقن المطالبات المحددة، مثل توجيه النموذج لنسخ مسارات الاستدلال المرفقة حرفياً داخل وسوم مخصصة.
- تعاملت النماذج مع مسارات استدلالها الخاصة على أنها مقدسة، مما جعلها شديدة التأثر باتباع التعليمات المضمنة داخل هذه القطع المعاد تشغيلها.
تسلط الورقة الضوء على أن هذه الطريقة تكشف عن رموز الاستدلال الداخلية التي لم يُقصد أبداً استهلاكها من قبل البشر، وتكشف عن نوع جديد من حقن المطالبات. ومع ذلك، يلاحظ المؤلفون أن جميع مقدمي النماذج أقرّوا بالتقرير وقاموا لاحقاً بترقيع الثغرة.