OpenAI a publié des lignes directrices initiales préconisant des « dossiers de sécurité » structurés — des arguments de risque complets et fondés sur des preuves — avant de poursuivre toute exécution d'entraînement par renforcement de pointe. L'organisation vise à codifier ces pratiques comme une norme idéale pour gérer la complexité émergente des modèles d'IA avancés.
Le cadre proposé exige que les dossiers de sécurité couvrent trois aspects techniques : l'entraînement à l'alignement, le confinement et la surveillance. Les mesures clés incluent des revues automatisées et manuelles des ensembles de données, le réglage des évaluateurs, des évaluations hors ligne de l'alignement et des tests rétrospectifs pour prévenir les contournements du système de récompense et les désalignements. Les stratégies de confinement impliquent le durcissement de l'infrastructure bac à sable, la réalisation de tests d'intrusion de confinement avec des points de contrôle de pointe, la limitation de la communication entre échantillons et l'utilisation de journaux immuables pour l'enquête sur les incidents.
Les meilleures pratiques opérationnelles incluent l'exigence de dissensions en amont, l'approbation par la haute direction avec pouvoir de veto, et une responsabilité définie pour les exécutions d'entraînement. Les lignes directrices décrivent également des protocoles pour enquêter sur des incidents graves de désalignement, tels que l'analyse des causes racines, les divulgations publiques et la création de tests de régression pour prévenir des comportements similaires futurs.
OpenAI met actuellement en œuvre ces recommandations en interne et s'attend à ce que les pratiques évoluent au fur et à mesure qu'elle itère sur ses processus de sécurité internes.