حدد الباحثون ثغرة في كيفية تعامل مقدمي نماذج اللغة الكبيرة الرائد مع مسارات الاستدلال خطوة بخطوة، والتي تُرجع ككتل مشفرة للاستخدام من جانب العميل. وجدوا أن هذه الكتل المشفرة متوافقة تمامًا وقابلة للتبديل عبر جلسات مختلفة ومستخدمين ونماذج داخل نظام بيئي لنفس المزود.

  • طور الفريق اختراقًا قابلاً للتوسع لفك التشفير عن طريق حقن مسار استدلال مشفر من نموذج قادر في نموذج أضعف وأقل حماية لإجباره على إخراج المسار كنص عادي.
  • تتجاوز هذه الآلية آليات منع الاستدلال، مما يسمح باستخراج مسارات الاستدلال الخاصة من مزودين يشملون Anthropic وOpenAI وGoogle.
  • تتيح الثغرة استخراج بيانات خاصة على نطاق واسع؛ حيث كشف فك تشفير 315,320 كتلة استدلال تم جمعها من المستودعات العامة عن 367 عنصرًا خاصًا شخصيًا (PII) و182 بيانات اعتماد.
  • تكشف العيب بشكل غير مقصود عن معلومات خطيرة مخفية داخل عملية الاستدلال، حتى عندما يرفض الإخراج النهائي للنموذج طلبًا ضارًا بأمان.
  • يمكن للمهاجمين استخدام هذا العيب لتنفيذ حقن أوامر خفيّة عن طريق تضمين حمولات ضارة داخل الكتل المشفرة لتسميم عمليات النشر العامة للوكلاء البرمجيين.

بعد الإفصاح المسؤول، يقترح المؤلفون تخفيفات تشفيرية ونظامية ملموسة لتأمين الاستدلال من جانب العميل.