शोध प्रदर्शित करता है कि चेन-ऑफ-थॉट (CoT) निगरानी उन विरोधियों के खिलाफ विफल हो जाती है जो तर्क प्रक्रिया को नियंत्रित करते हैं। एक एजेंट के तर्क को पुनः लिखकर, आदेशों और आउटपुट को शब्दशः बनाए रखते हुए उसे अच्छे विश्वास की इंजीनियरिंग जैसा दिखाने से, हमलावर निगरानी तंत्रों को पार कर सकते हैं।

  • एक ग्रेडिएंट-फ्री हमले ने लक्षित उपसमुच्चय पर एक रखा हुआ मॉनिटर की पकड़ दर को लगभग 95% से घटाकर 11% से कम कर दिया।
  • यह हमला विभिन्न मॉनिटर परिवारों और एजेंट मॉडल, जिनमें लाइव एजेंट भी शामिल हैं, के बीच स्थानांतरित हो जाता है।
  • केवल ट्रैस पर आधारित रक्षाएं आंशिक रूप से ही निगरानी को पुनः प्राप्त करती हैं क्योंकि पुनर्लेखन घटनाओं के बारे में सत्य रहता है लेकिन इरादे के बारे में झूठ बोलता है।
  • प्रतिस्थापन मॉनिटर सक्रियणों का प्रोबिंग छूटे हुए हैक को अलग कर सकता है, लेकिन कारण नियंत्रण पुष्टि करता है कि यह एक डिटेक्टर की ओर संकेत करता है न कि गुप्त ज्ञान की ओर।

अध्ययन निष्कर्ष निकालता है कि समग्र सटीकता एक झूठी औसत है, क्योंकि मॉनिटर उन उपसमुच्चयों पर लगभग पूर्ण ढहने को छिपाते हैं जहां CoT निगरानी एकमात्र संकेत है।