قدم الباحثون ReasAlign، وهو حل على مستوى النموذج مصمم لتحسين محاذاة السلامة في نماذج اللغات الكبيرة (LLLMs) ضد هجمات حقن الأوامر غير المباشرة. يدمج النهج خطوات استدلال منظمة لتحليل استفسارات المستخدم واكتشاف التعليمات المتضاربة، مما يضمن استمرارية المهام المقصودة من قبل المستخدم.

  • يستخدم ReasAlign آلية توسيع عند الاختبار مع نموذج حكم مُحسّن للتفضيل لتقييم خطوات الاستدلال واختيار المسار الأفضل.
  • على معيار CyberSecEval2، يحقق 94.6% من الفائدة ومعدل نجاح هجوم (ASR) بنسبة 3.6% فقط.
  • تتفوق هذه الأداء بشكل كبير على Meta SecAlign، الذي سجل 56.4% من الفائدة و74.4% ASR في نفس المهام.

يذكر المؤلفون أن ReasAlign يؤسس دفاعاً قوياً وعملياً ضد هجمات حقن الأوامر في الأنظمة الوكيلة الواقعية من خلال تحقيق أفضل توازن بين السلامة والفائدة.