قام الباحثون بتعميم هجمات الحرمان من الخدمة أثناء الاستدلال (PI-DoS) التي تستغل التكلفة الحسابية العالية للاستدلال الصريح متعدد الخطوات في نماذج الاستدلال الكبيرة (LRMs). يقدمون ReasoningBomb، وهو إطار عمل يعتمد على التعلم المعزز لتدريب مهاجم على توليد مطالبات طبيعية قصيرة تدفع النماذج الضحية إلى مسارات استدلال طويلة مرضياً وغالباً ما لا تنتهي.

  • عبر سبعة نماذج مفتوحة المصدر وثلاثة نماذج LRM تجارية، يُحدث ReasoningBomb متوسط 18,759 رمز إكمال و19,263 رمز استدلال.
  • تتفوق الطريقة على الأساس الثاني بنسبة 35% في رموز الإكمال و38% في رموز الاستدلال.
  • تحقق نسبة تضخيم من الإدخال إلى الإخراج تبلغ 286.7x في المتوسط مقارنة بالاستعلامات البريئة.
  • يتجاوز ReasoningBomb الكشف بنجاح بنسبة 99.8% على أساس المدخلات، و98.7% على أساس المخرجات، و98.4% ضد الكشف المشترك الصارم ذو المرحلتين.

تسلط هذه الدراسة الضوء على ثغرة جديدة في نماذج LRM حيث يمكن تسخير القدرة على الاستدلال المطول لإنشاء ظروف حرجة للحرمان من الخدمة عبر هندسة المطالبات المتخفية.