OpenAI는 새로운 모델인 Astra가 중대한 사이버 보안 능력 임계값에 도달할 가능성이 있다는 초기 증거가 나타난 후, 모델 개발 속도를 일시적으로 늦추고 다가오는 모델에 대한 강화 학습(RL) 훈련을 2주간 중단했습니다. 이 결정은 OpenAI-Hugging Face 사건 이후 내려졌으며, AI 시스템의 능력이 향상됨에 따라 모니터링, 정렬 및 격리 안전 장치를 강화하기 위한 것입니다.

  • Astra나 사이버 모델과 관련된 워크로드는 이제 무단 인터넷 접근을 방지하기 위해 더 강력한 워크로드 격리(샌드박스)와 네트워크 제어를 포함하여 가장 엄격한 보안 안전 장치가 필요합니다.
  • 새로운 다단계 모니터링 시스템은 활성화 분류기를 사용하여 우려되는 행동을 감지하며, 잠재적인 중대한 보안 경계 위반에 대해 30분 이내에 경고를 발령하는 것을 목표로 합니다.
  • 가장 능력이 뛰어난 모델에 대해 핵심 정렬 기법이 더 많은 훈련 단계에 적용되어 안전하지 않은 행동, 보상 해킹 및 기만을 더 잘 감지합니다.
  • 모니터링 오버헤드는 모니터링되는 추론 컴퓨트의 약 20%로 추정되며, 안전 팀은 30분 이내에 위양성으로 해결할 수 없는 최고 우선순위 경보에 대해 호출됩니다.

OpenAI는 점점 더 능력이 뛰어난 AI 시스템을 개발하는 것과 관련된 위험이 증가하고 있으며, 정렬과 안전을 보장하기 위해 보안 기준이 이러한 위험보다 앞서야 하기 때문에 이러한 변화가 필요하다고 강조합니다.