OpenAI는 최첨단 강화학습 학습을 계속하기 전에 포괄적이고 증거 기반의 위험 논증인 구조화된 "안전 사례"를 옹호하는 초기 가이드라인을 게시했습니다. 이 조직은 고급 AI 모델의 출현적 복잡성을 관리하기 위해 이러한 관행을 이상적인 표준으로 규정화하는 것을 목표로 합니다.

제안된 프레임워크는 안전 사례가 정렬 학습, 격리 및 모니터링이라는 세 가지 기술적 측면을 다루도록 요구합니다. 주요 조치에는 자동 및 수동 데이터셋 검토, 그레이더 튜닝, 오프라인 정렬 평가, 보상 해킹과 불일치를 방지하기 위한 백테스팅이 포함됩니다. 격리 전략에는 샌드박스 인프라의 강화, 최첨단 체크포인트를 사용한 격리 레드팀링, 샘플 간 통신 제한 및 사고 조사를 위한 불변 트랜스크립트 사용이 포함됩니다.

운영 모범 사례에는 사전 사후 이의제기, 거부권을 가진 최고 경영진의 승인, 학습 실행에 대한 명확한 책임 소재 요구가 포함됩니다. 가이드라인은 근원 원인 분석, 공개 발표 및 향후 유사한 동작을 방지하기 위한 회귀 테스트 생성과 같은 심각한 불일치 사고 조사에 대한 프로토콜도 명시합니다.

OpenAI는 현재 내부적으로 이러한 권장 사항을 구현 중이며, 내부 안전 프로세스를 반복함에 따라 이러한 관행이 진화할 것으로 예상합니다.