تقدم ورقة بحثية من Multiverse Computing طريقة لتدريب نماذج اللغة على رفض مجموعات فرعية محددة ضارة ضمن موضوع ما، بدلاً من رفض الفئة بأكملها، مما يعالج قيود حواجز الحماية السطحية القائمة على الموضوع. تعتمد هذه الطريقة على التنقيح الذاتي الواعي بالحدود مع إصلاح التغطية وبيانات بريئة موزعة داخلياً للحفاظ على الأمان مع تقليل الرفض الخاطئ للمطالبات المشروعة.
- تقلل استراتيجية إعادة المحاولة التصاعدية من فشل توليد المطالبات من 19.88% إلى 0.20%, مع الحفاظ على 40,293 مثالاً تدريبياً ضاراً.
- يساهم تضمين 11,955 مطالبة بريئة مؤكدة الخطورة السطحية في التخفيف من الرفض الخاطئ للمحتوى الآمن.
- تقيس الأزواج المحجوزة من الضارة والبريئة دقة الحد مباشرة، وتظهر أن إضافة بيانات حدود بريئة تقلل من الرفض المفرط من 32.94% إلى 4.16% مع انخفاض طفيف فقط في رفض المحتوى الضار (من 91.88% إلى 87.72%).
يجادل المؤلفون بأن ضبط الأمان يجب أن يقيّم كلاً من الجانبين الضار والبريء للحد، لأن التحسين لرفض المحتوى الضار وحده قد يجعل النماذج عديمة الفائدة في الاستفسارات المشروعة.