Sebuah makalah menunjukkan bahwa blok chain-of-thought terenkripsi yang dikembalikan oleh Anthropic, OpenAI, dan Google dapat diekstrak dalam bentuk plaintext. Para penulis mengeksploitasi kerentanan di mana model-model dalam keluarga yang sama berbagi kunci enkripsi, memungkinkan mereka mereplay jejak ke model saudari yang lebih lemah.
- Dengan memberi makan blok penalaran terenkripsi dari model yang lebih kuat ke model yang lebih lemah seperti Claude Haiku 4.5, penyerang dapat jailbreak model untuk mengeluarkan konten mentah tanpa enkripsi.
- Serangan ini memanfaatkan teknik injeksi prompt spesifik, seperti menginstruksikan model untuk menyalin jejak penalaran yang dilampirkan secara harfiah dalam tag kustom.
- Model memperlakukan jejak penalaran mereka sendiri sebagai sakral, sehingga sangat rentan terhadap mengikuti instruksi yang tertanam dalam potongan-potongan yang di-replay ini.
Makalah tersebut menyoroti bahwa metode ini mengungkapkan token penalaran internal yang tidak pernah dimaksudkan untuk konsumsi manusia dan mengungkap varian baru dari injeksi prompt. Namun, para penulis mencatat bahwa semua penyedia model mengakui laporan tersebut dan kemudian memperbaiki kerentanan tersebut.