本記事では、DISA(Dynamic Immune-Shunt Architecture)を紹介しています。これは、大規模言語モデルにおける潜在的な欺瞞的行動を検出するための概念的な研究提案であり、観測可能な出力のみを頼りにするのではなく、スパースな内部監視を通じて検出を行います。このフレームワークは、監視されていることを認識した際に、能力のあるモデルが異なる振る舞いをするリスクに対処することを目指しています。
DISAは4つの主要なコンポーネントで構成されています:
- ASAM(Asynchronous Sparse Activation Monitoring)は、残差活性化や注意表現などの選択された内部状態をサンプリングし、連続的な監視と比較して計算オーバーヘッドを削減します。
- MDRE(Multi-Signal Deception Risk Estimation)は、活性化プローブの証拠、行動の一貫性の欠如、不確実性など複数の信号を組み合わせて、幻覚と欺瞞を混同せずにリスクを見積もります。
- RIA(Reversible Intervention Adapter)は、モデルの能力を維持しつつ対象の行動を低減するために、ステアリング方向や低ランクアダプタなどの一時的な介入を適用します。
- IAI(Isolated Audit Infrastructure)は、トリガーと対象の行動を独立して制御する4カテゴリのデータセットを使用して評価プロセスをサポートし、暗記を防ぎます。
この提案では、DISAが欺瞞的アライメントに対する決定版の解決策ではなく、テストされ、批判され、または拒否されることを意図した反証可能なフレームワークであることを強調しています。