एक पेपर में दिखाया गया है कि Anthropic, OpenAI और Google द्वारा लौटाए गए एन्क्रिप्टेड चेन-ऑफ़-थॉट ब्लॉक प्लेनटेक्स्ट में निकाले जा सकते हैं। लेखकों ने एक कमजोरी का फायदा उठाया जहाँ समान परिवार के मॉडल एन्क्रिप्शन कुंजी साझा करते थे, जिससे वे ट्रेस को कमजोर भाई-बहन मॉडल में रीप्ले कर सके।

  • मजबूत मॉडल से एन्क्रिप्टेड तर्क ब्लॉक को Claude Haiku 4.5 जैसे कमजोर मॉडल में डालकर, हमलावरों ने मॉडल को जेलब्रेक कर कच्चे, अएन्क्रिप्टेड सामग्री को आउटपुट करने के लिए तैयार किया।
  • इस अटैक में विशिष्ट प्रॉम्प्ट इंजेक्शन तकनीकों का उपयोग किया गया, जैसे कि मॉडल को कस्टम टैग के भीतर संलग्न तर्क को शब्दशः ट्रांसक्राइब करने का निर्देश देना।
  • मॉडल अपने स्वयं के तर्क ट्रेस को पवित्र मानते हैं, जिससे वे इन रीप्ले किए गए खंडों में एम्बेडेड निर्देशों का पालन करने के लिए अत्यधिक संवेदनशील हो जाते हैं।

पेपर में उजागर किया गया है कि यह विधि आंतरिक तर्क टोकन को प्रकट करती है जो कभी भी मानव उपभोग के लिए नहीं थे और प्रॉम्प्ट इंजेक्शन का एक नया प्रकार उजागर करती है। हालाँकि, लेखकों ने नोट किया कि सभी मॉडल प्रदाताओं ने रिपोर्ट को स्वीकार किया और बाद में इस कमजोरी को ठीक कर दिया।