نشرت OpenAI إرشادات أولية تدعو إلى اعتماد "حالات سلامة" منظمة - وهي حجج مخاطر شاملة ومبنية على الأدلة - قبل المضي قدماً في أي عملية تدريب باستخدام التعلم التعزيزي المتقدم. تهدف المنظمة إلى توثيق هذه الممارسات كمعيار طموش لإدارة التعقيد الناشئ عن نماذج الذكاء الاصطناعي المتقدمة.
يتطلب الإطار المقدم أن تغطي حالات السلامة ثلاثة جوانب تقنية: التدريب على المحاذاة، والحجز، والمراقبة. وتشمل التدابير الرئيسية مراجعة مجموعات البيانات آلياً وبشكل يدوي، وضبط المقيِّمين، وتقييمات المحاذاة غير المتصلة بالإنترنت، واختبار إعادة التشغيل لمنع اختلاسات المكافآت وعدم المحاذاة. تتضمن استراتيجيات الحجز تعزيز بنية البيئة المعزولة، وإجراء اختبارات الاختراق للحجز مع نقاط التفتيش المتقدمة، وتقليل التواصل بين العينات، واستخدام سجلات غير قابلة للتعديل لتحقيقات الحوادث.
تشمل أفضل الممارسات التشغيلية اشتراض آراء معارضة ما قبل التنفيذ، وموافقات القيادة العليا ذات حق النقض (الفيتو)، وتحديد المساءلة عن عمليات التدريب. كما ترسم الإرشادات بروتوكولات للتحقيق في حوادث عدم المحاذاة الخطيرة، مثل تحليل السبب الجذري، والإفصاحات العامة، وإنشاء اختبارات الانحدار لمنع تكرار السلوكيات المماثلة مستقبلاً.
تقوم OpenAI حالياً بتنفيذ هذه التوصيات داخلياً وتتوقع أن تتطور الممارسات مع تكرارها لعمليات السلامة الداخلية.