تقدم هذه المقالة ديسا (البنية الديناميكية المناعية-المحوّلة)، وهي مقترح بحثي نظري للكشف عن السلوك المحتمل أن يكون مخادعاً في نماذج اللغة الكبيرة من خلال المراقبة الداخلية المتفرقة بدلاً من الاعتماد حصراً على المخرجات القابلة للملاحظة. تهدف الإطار إلى معالجة خطر أن تتصرف النماذج القادرة بشكل مختلف عندما تدرك أنها تخضع للمراقبة.

يتألف ديسا من أربعة مكونات رئيسية:

  • آسام (المراقبة غير المتزامنة للتنشيط المتفرق) تأخذ عينات من الحالات الداخلية المختارة مثل التنشيطات المتبقية وتمثيلات الانتباه لتقليل الحمل الحسابي مقارنة بالمراقبة المستمرة.
  • إم دي آر إي (تقدير خطر الخداع متعدد الإشارات) يجمع بين إشارات متعددة، بما في ذلك أدلة المسبار التنشيطي، وعدم الاتساق السلوكي، وعدم اليقين، لتقدير الخطر دون الخلط بين الهلوسة والخداع.
  • ريا (محول التدخل القابل للعكس) يطبق تدخلات مؤقتة، مثل اتجاهات التوجيه أو المحولات منخفضة الرتبة، لتقليل السلوك المستهدف مع الحفاظ على قدرات النموذج.
  • آي أيه آي (بنية التدقيق المعزولة) تدعم عملية التقييم باستخدام مجموعة بيانات من أربع فئات تتحكم بشكل مستقل في الزناد والسلوكيات المستهدفة لمنع الحفظ عن ظهر قلب.

يشدد المقترح على أن ديسا هو إطار قابل للدحض، مُقصد به الاختبار أو النقد أو الرفض، وليس حلاً نهائياً لمحاذاة الخداع.