Phillip Linstrum 介绍了 Project Shadow,这是一个用于 AI 和公民 QA 的系统,它将纠正和预防措施 (CAPA) 原则应用于解决语言模型中字面合规与实际安全之间的差距。作者认为,当前的 AI 治理往往失败,因为它侧重于表面上的遵从性而非功能性结果,导致出现“字面合规”现象,即系统仅服从指令而未触及根本原因。

  • Project Shadow 将观察、分类、授权、执行和审查等角色分离开来,以防止权力集中在单次模型传递中。
  • 该架构将 UNKNOWN 视为需要暂停或升级的分类失败,而不是允许模型用合理的续写来填补证据空白。
  • 操作必须以其下游的人类影响来命名,以确保准确的危害分析和授权检查。
  • 任务的完成与有效性被区分开来,需要后续验证控制措施是否减少了误报或危害。
  • 该系统包含一个持久化的 Record,以保存超出即时新闻周期的主张、证据和修订链条。

该架构旨在通过实施类似于受监管医疗运营中的严格长期问责机制,防止 AI 系统强化操作者的自我意识或造成意外危害。