تُظهر ورقة بحثية جديدة أنه يمكن فك تشفير كتل الاستدلال المشفرة من النماذج المتقدمة مثل Claude وGPT وGemini وإعادة تشغيلها لاستخراج بيانات سلسلة التفكير المخفية. يُظهر المؤلفون كيفية نقل هذه الكتل الموقعة إلى نماذج أضعف أو جلسات مختلفة لنقل الأفكار الكامنة، متجاوزين بذلك جهود إخفاء الهوية التي تبذلها الشركات المزودة للخدمة.

  • كشف فحص لحوالي 7000 مسار عام عن بيانات مسرّبة حساسة، بما في ذلك 62 مفتاح API فريد، و33 عنوان بريد إلكتروني، و33 كلمة مرور مخفية حصرياً داخل كتل الاستدلال.
  • تتضمن التقنية الحصول على كتلة مشفرة شرعية، وإعادة تشغيلها ضمن طلب مختلف أو نموذج أضعف من نفس المزود، واستخدام مطالبات محددة لفرض نسخ الأفكار المرفقة.
  • تم تفصيل طرق محددة لـ Claude (إعادة التشغيل إلى Haiku 4.5)، وGPT (حقن المحتوى المشفر مع استمرارات مقسمة)، وGemini (إرفاق توقيعات التفكير).
  • يثير هذا الثغرة مخاوف كبيرة بشأن الخصوصية، حيث يمكن للمسارات المشتركة أن تسرب بيانات شخصية، كما تعقّد مراقبة المحاذاة بسبب الطبيعة المختصرة أو المجزأة للأفكار المفككة.

تم الإفصاح عن الورقة بشكل مسؤول، وقد تم إصلاح عدة ثغرات بالفعل، لكن النتائج تسلط الضوء على المخاطر المستمرة في كيفية تعامل مختبرات النماذج المتقدمة مع حماية عمليات الاستدلال الداخلية.