필립 린스트럼은 언어 모델의 문자적 준수와 실제 안전성 사이의 격차를 해소하기 위해 시정 및 예방 조치(CAPA) 원칙을 적용하는 AI 및 시민 QA를 위한 시스템인 프로젝트 섀도를 제시합니다. 저자는 현재 AI 거버넌스가 기능적 결과보다 표면적 준수에 초점을 맞추어 시스템이 근본 원인을 해결하지 않고 지시사항만 따르는 "문자적 준수" 상황을 초래하기 때문에 종종 실패한다고 주장합니다.

  • 프로젝트 섀도는 단일 모델 패스 내에서 권력이 집중되는 것을 방지하기 위해 관찰, 분류, 권한, 실행 및 검토와 같은 역할을 분리합니다.
  • 이 아키텍처는 UNKNOWN을 합리적인 연속으로 증거 격차를 채우는 것을 허용하는 대신 일시 중단 또는 승인이 필요한 분류 실패로 처리합니다.
  • 정확한 피해 분석과 권한 검증을 보장하기 위해 작업은 하류의 인간적 영향을 기준으로 명명되어야 합니다.
  • 작업 완료와 효과성은 구분되며, 통제가 위양성이나 피해를 줄이는지 확인하기 위한 후속 검증이 필요합니다.
  • 이 시스템에는 즉각적인 뉴스 주기를 넘어 주장, 증거 및 수정의 연결고리를 보존하기 위한 영구 레코드가 포함되어 있습니다.

이 아키텍처는 규제된 의료 운영과 유사한 엄격하고 장기적인 책임 메커니즘을 강제함으로써 AI 시스템이 운영자의 자아를 강화하거나 의도치 않은 피해를 초래하는 것을 방지하는 것을 목표로 합니다.