A OpenAI publicou diretrizes iniciais defendendo "casos de segurança" estruturados — argumentos de risco abrangentes e baseados em evidências — antes de prosseguir com qualquer execução de treinamento de reforço de fronteira. A organização visa codificar essas práticas como um padrão aspiracional para gerenciar a complexidade emergente de modelos avançados de IA.
O framework proposto exige que os casos de segurança cubram três aspectos técnicos: treinamento de alinhamento, contenção e monitoramento. As principais medidas incluem revisões automatizadas e manuais de conjuntos de dados, ajuste de avaliadores, avaliações offline de alinhamento e backtesting para prevenir hacks de recompensa e desalinhamento. Estratégias de contenção envolvem endurecer a infraestrutura de sandbox, realizar testes de penetração de contenção com checkpoints de fronteira, limitar a comunicação entre amostras e usar registros imutáveis para investigação de incidentes.
As melhores práticas operacionais incluem exigir dissensos pré-morte, aprovações da alta liderança com poder de veto e responsabilidade definida para execuções de treinamento. As diretrizes também delineiam protocolos para investigar incidentes graves de desalinhamento, como análise de causa raiz, divulgações públicas e criação de testes de regressão para prevenir comportamentos semelhantes no futuro.
A OpenAI está atualmente implementando essas recomendações internamente e espera que as práticas evoluam à medida que iteram em seus processos internos de segurança.