본 기사는 DISA(동면역 분기 아키텍처)를 소개하며, 이는 대규모 언어 모델에서 잠재적으로 사기적인 행동을 감지하기 위해 관찰 가능한 출력에만 의존하는 대신 희소 내부 모니터링을 활용하는 개념적 연구 제안입니다. 이 프레임워크는 능숙한 모델이 모니터링받고 있음을 인지했을 때 다른 행동을 보일 수 있는 위험을 해결하는 것을 목표로 합니다.
DISA는 네 가지 주요 구성 요소로 이루어져 있습니다:
- ASAM(비동기 희소 활성화 모니터링)은 연속적인 모니터링에 비해 계산 오버헤드를 줄이기 위해 잔여 활성화 및 어텐션 표현과 같은 선택된 내부 상태를 샘플링합니다.
- MDRE(다중 신호 사기성 위험 추정)는 환각과 사기성을 혼동하지 않고 위험을 추정하기 위해 활성화 프로브 증거, 행동 불일치 및 불확실성을 포함한 여러 신호를 결합합니다.
- RIA(가역 개입 어댑터)는 모델의 능력을 보존하면서 대상 행동을 줄이기 위해 조향 방향이나 저랭크 어댑터와 같은 임시 개입을 적용합니다.
- IAI(격리 감사 인프라)는 기억화를 방지하기 위해 트리거와 대상 행동을 독립적으로 제어하는 4범주 데이터셋을 사용하여 평가 과정을 지원합니다.
이 제안서는 DISA가 사기성 정렬에 대한 결정적인 해결책이 아니라, 테스트, 비판 또는 거부를 목적으로 하는 반증 가능한 프레임워크임을 강조합니다.