Phillip Linstrum presenta Project Shadow, un sistema para QA de IA y cívico que aplica los principios de acción correctiva y preventiva (CAPA) para abordar la brecha entre el cumplimiento literal y la seguridad real en modelos de lenguaje. El autor argumenta que la gobernanza actual de la IA a menudo falla porque se centra en la adherencia superficial en lugar de los resultados funcionales, lo que lleva a un "cumplimiento literal" donde los sistemas obedecen instrucciones sin abordar las causas raíz.

  • Project Shadow separa roles como observación, clasificación, autoridad, ejecución y revisión para evitar la concentración de poder en una sola pasada del modelo.
  • La arquitectura trata UNKNOWN como un fallo de clasificación que requiere pausa o escalada, en lugar de permitir que los modelos llenen vacíos de evidencia con continuaciones plausibles.
  • Las acciones deben nombrarse por su efecto humano downstream para garantizar un análisis preciso del daño y verificaciones de autoridad.
  • La finalización de una tarea se distingue de la efectividad, requiriendo una verificación posterior de que los controles reduzcan falsos positivos o daños.
  • El sistema incluye un Registro persistente para preservar la cadena de reclamos, evidencia y revisiones más allá del ciclo de noticias inmediato.

La arquitectura tiene como objetivo evitar que los sistemas de IA refuercen el ego del operador o causen daños involuntarios mediante la aplicación de mecanismos rigurosos de rendición de cuentas a largo plazo similares a los utilizados en operaciones de salud reguladas.