В данной статье представлена DISA (Dynamic Immune-Shunt Architecture), концептуальное исследовательское предложение по обнаружению потенциально обманчивого поведения в больших языковых моделях с помощью разреженного внутреннего мониторинга, а не исключительно на основе наблюдаемого вывода. Эта система направлена на решение риска того, что способные модели могут вести себя иначе, когда осознают, что за ними наблюдают.
DISA состоит из четырех основных компонентов:
- ASAM (Asynchronous Sparse Activation Monitoring) выбирает определенные внутренние состояния, такие как остаточные активации и представления внимания, чтобы снизить вычислительную нагрузку по сравнению с непрерывным мониторингом.
- MDRE (Multi-Signal Deception Risk Estimation) объединяет несколько сигналов, включая доказательства из активационных зондов, поведенческую несогласованность и неопределенность, для оценки риска без смешивания галлюцинаций с обманом.
- RIA (Reversible Intervention Adapter) применяет временные вмешательства, такие как направления управления или адаптеры низкого ранга, чтобы снизить целевое поведение, сохраняя при этом возможности модели.
- IAI (Isolated Audit Infrastructure) поддерживает процесс оценки с помощью четырехкатегорийного набора данных, который независимо контролирует триггеры и целевые поведения для предотвращения запоминания.
Предложение подчеркивает, что DISA является фальсифицируемой системой, предназначенной для тестирования, критики или отклонения, а не окончательным решением проблемы обманчивого выравнивания.