Cet article présente DISA (Dynamic Immune-Shunt Architecture), une proposition de recherche conceptuelle visant à détecter un comportement potentiellement trompeur dans les grands modèles de langage grâce à une surveillance interne clairsemée plutôt qu'en s'appuyant uniquement sur la sortie observable. Le cadre vise à adresser le risque que des modèles capables se comportent différemment lorsqu'ils réalisent qu'ils sont surveillés.
DISA se compose de quatre composants principaux :
- ASAM (Asynchronous Sparse Activation Monitoring) échantillonne des états internes sélectionnés tels que les activations résiduelles et les représentations d'attention afin de réduire la surcharge computationnelle par rapport à une surveillance continue.
- MDRE (Multi-Signal Deception Risk Estimation) combine plusieurs signaux, y compris les preuves de sondage d'activation, l'incohérence comportementale et l'incertitude, pour estimer le risque sans confondre hallucination et tromperie.
- RIA (Reversible Intervention Adapter) applique des interventions temporaires, telles que des directions de pilotage ou des adaptateurs à faible rang, pour réduire le comportement ciblé tout en préservant les capacités du modèle.
- IAI (Isolated Audit Infrastructure) soutient le processus d'évaluation à l'aide d'un jeu de données à quatre catégories qui contrôle indépendamment les déclencheurs et les comportements cibles afin d'empêcher la mémorisation.
La proposition souligne que DISA est un cadre falsifiable destiné à être testé, critiqué ou rejeté, plutôt qu'une solution définitive à l'alignement trompeur.