OpenAI telah menerbitkan pedoman awal yang menganjurkan penggunaan "kasus keamanan" yang terstruktur—argumen risiko komprehensif berbasis bukti—sebelum melanjutkan setiap sesi pelatihan pembelajaran penguatan terdepan. Organisasi ini bertujuan untuk mengkodifikasi praktik-praktik tersebut sebagai standar aspirasional guna mengelola kompleksitas emergent dari model AI canggih.

Kerangka kerja yang diusulkan mensyaratkan kasus keamanan mencakup tiga aspek teknis: pelatihan penyelarasan, penahanan, dan pemantauan. Langkah-langkah kunci meliputi tinjauan dataset otomatis dan manual, penyetelan grader, evaluasi penyelarasan offline, dan backtesting untuk mencegah hack hadiah dan ketidakselarasan. Strategi penahanan melibatkan penguatan infrastruktur sandbox, pelaksanaan red-teaming penahanan dengan checkpoint terdepan, pembatasan komunikasi lintas sampel, serta penggunaan transkrip yang tidak dapat diubah untuk penyelidikan insiden.

Praktik operasional terbaik mencakup persyaratan dissensi pra-matem, persetujuan kepemimpinan senior dengan hak veto, dan akuntabilitas terdefinisi untuk sesi pelatihan. Pedoman tersebut juga menguraikan protokol untuk menyelidiki insiden ketidakselarasan parah, seperti analisis akar penyebab, pengungkapan publik, dan pembuatan uji regresi untuk mencegah perilaku serupa di masa depan.

OpenAI saat ini menerapkan rekomendasi ini secara internal dan mengharapkan praktik-praktik tersebut berkembang seiring iterasi pada proses keamanan internal mereka.