Qwen2-1.5B 모델에 대한 어휘-로짓 스티어링의 인과적 조사는 스티어링 벡터의 최대 좌관이 반드시 관찰된 행동 효과의 원인임을 보여주지 않는다. ntrillard가 수행한 이 연구는 희소 순위 로짓 스티어링이 토큰 생성에 미치는 영향을 분석하고 이러한 변화를 주도하는 구체적인 구조적 구성 요소를 식별한다.
- 목표 단어 생성(수송)은 K≈150 부근에서 나타나며 K≈300까지 지속되며, K=200는 최대 정렬 지점이지만 유일한 행동 최적점은 아니다.
- 순수 행(W) 투영(λ=1)은 30개 시드 전체에 걸쳐 수송이 전혀 없으며, λ<1 조건은 모두 행 밖 성분을 nonzero로 유지하고 일부 수송을 보인다.
- 이 효과는 의미적 수송이 아닌 어휘 강제력으로 식별되며, 상위 200개 어휘 이웃을 부스트하면 30개 중 27개에서 수송이 발생하지만, 부스트하지 않은 의미적 이웃은 30개 중 0개에서 수송이 발생한다.
- 최대 좌관 하나를 삭제해도 효과가 사라지지 않아 스티어링 벡터에 단일 하중 지지 좌관이 없음을 시사한다.
- 접두사 또는 자기 컨텍스트마다 벡터를 동적으로 재계산하면 벡터가 거의 변하지 않으며 정적 벡터 대비 성능이 향상되지 않는다.
이 결과는 좌관 정체성과 순위 크기 간 상호작용이 스티어링 성공에 중요함을 시사하며, 모델 행동을 주도하는 벡터 구성 요소에 대한 가정을 도전한다.