फिलिप लिन्स्ट्रम प्रोजेक्ट शेडो पेश करते हैं, जो AI और नागरिक QA के लिए एक प्रणाली है जो भाषा मॉडलों में अक्षरात्मक अनुपालन और वास्तविक सुरक्षा के बीच की खाई को दूर करने के लिए सुधार और निवारण कार्रवाई (CAPA) सिद्धांतों को लागू करती है। लेखक का तर्क है कि वर्तमान AI शासन अक्सर विफल रहता है क्योंकि यह सतही अनुपालन पर केंद्रित होता है, न कि कार्यात्मक परिणामों पर, जिससे "अक्षरात्मक अनुपालन" की स्थिति उत्पन्न होती है जहां प्रणालियाँ निर्देशों का पालन करती हैं लेकिन मूल कारणों को नहीं संबोधित करती हैं।

  • प्रोजेक्ट शेडो शक्ति के एकल मॉडल पास में केंद्रित होने से बचाने के लिए अवलोकन, वर्गीकरण, अधिकार, निष्पादन और समीक्षा जैसे भूमिकाओं को अलग करता है।
  • वास्तुकला UNKNOWN को एक वर्गीकरण विफलता मानती है जिसके लिए रोक या बढ़ावा की आवश्यकता होती है, इसके बजाय मॉडलों को साक्ष्य की खाई को संभावित निरंतरता से भरने की अनुमति देना।
  • सटीक हानि विश्लेषण और अधिकार जांच सुनिश्चित करने के लिए कार्रवाई को उनके डाउनस्ट्रीम मानवीय प्रभाव द्वारा नामित किया जाना चाहिए।
  • कार्य की पूर्णता को प्रभावकारिता से अलग किया गया है, जिसके लिए बाद में सत्यापन की आवश्यकता होती है कि नियंत्रण गलत धनात्मक या हानि को कम करते हैं।
  • तंत्र में एक स्थायी रिकॉर्ड शामिल है जो तात्कालिक समाचार चक्र से परे दावों, साक्ष्य और संशोधनों की श्रृंखला को बनाए रखता है।

वास्तुकला का उद्देश्य कठोर, दीर्घकालिक जवाबदेही तंत्रों को लागू करके AI प्रणालियों को संचालक के अहंकार को पुष्टि करने या अनचाहे हानि को होने से रोकना है, जो नियंत्रित स्वास्थ्य सेवा संचालन में पाए जाने वाले समान हैं।