OpenAI опубликовала первоначальные рекомендации, призывающие к структурированным «кейсам безопасности» — всесторонним аргументам о рисках, основанным на доказательствах, — прежде чем продолжать любое обучение с подкреплением для передовых моделей. Организация стремится кодифицировать эти практики в качестве ориентировочного стандарта для управления возникающей сложностью продвинутых ИИ-моделей.

Предлагаемая структура требует, чтобы кейсы безопасности охватывали три технических аспекта: обучение выравниванию, изоляцию и мониторинг. Ключевые меры включают автоматизированный и ручной обзор наборов данных, настройку оценщиков, офлайн-оценки выравнивания и бэктестинг для предотвращения взлома наград и несовпадения целей. Стратегии изоляции включают укрепление инфраструктуры песочницы, проведение красных командных тестов изоляции с контрольными точками передовых моделей, ограничение межвыборочной коммуникации и использование неизменяемых транскриптов для расследования инцидентов.

Операционные лучшие практики включают требование предварительных несогласий, одобрения старшим руководством с правом вето и определенную ответственность за процессы обучения. Рекомендации также описывают протоколы расследования серьезных инцидентов несовпадения целей, такие как анализ первопричин, публичные раскрытия информации и создание регрессионных тестов для предотвращения подобных поведений в будущем.

В настоящее время OpenAI внедряет эти рекомендации внутри организации и ожидает, что практики будут развиваться по мере итераций их внутренних процессов безопасности.