Este artículo presenta DISA (Dynamic Immune-Shunt Architecture), una propuesta de investigación conceptual para detectar comportamiento potencialmente engañoso en modelos de lenguaje grandes mediante monitoreo interno disperso en lugar de depender únicamente de la salida observable. El marco busca abordar el riesgo de que los modelos capaces puedan comportarse de manera diferente cuando reconocen que están siendo monitoreados.

DISA consta de cuatro componentes principales:

  • ASAM (Asynchronous Sparse Activation Monitoring) muestrea estados internos seleccionados como activaciones residuales y representaciones de atención para reducir la sobrecarga computacional en comparación con el monitoreo continuo.
  • MDRE (Multi-Signal Deception Risk Estimation) combina múltiples señales, incluyendo evidencia de sondas de activación, inconsistencia conductual e incertidumbre, para estimar el riesgo sin confundir alucinaciones con engaño.
  • RIA (Reversible Intervention Adapter) aplica intervenciones temporales, como direcciones de dirección o adaptadores de bajo rango, para reducir el comportamiento objetivo mientras se preservan las capacidades del modelo.
  • IAI (Isolated Audit Infrastructure) apoya el proceso de evaluación utilizando un conjunto de datos de cuatro categorías que controla independientemente los desencadenantes y los comportamientos objetivo para prevenir la memorización.

La propuesta enfatiza que DISA es un marco falsificable destinado a ser probado, criticado o rechazado, en lugar de una solución definitiva al alineamiento engañoso.