对 Qwen2-1.5B 模型上词汇-logit 转向的因果研究表明,转向向量中最大的坐标并不一定导致观察到的行为效应。由 ntrillard 进行的研究分析了稀疏排序 logit 转向如何影响词元生成,并确定了驱动这些变化的具体结构组件。
- 传输(目标词的生成)在 K≈150 时出现,并持续到 K≈300,其中 K=200 是对齐度最高的点,但并非唯一的行为最优解。
- 纯行(W)投影 (λ=1) 在 30 个种子中显示零传输,而每个 λ<1 的条件都保留了非零的行外分量并显示出一定的传输。
- 该效应被识别为词汇强制而非语义传输;增强前 200 个词汇邻居可产生 27/30 的传输,而未增强的语义邻居则产生 0/30 的传输。
- 删除单个最大坐标并不会消除该效应,表明转向向量中不存在任何单一的承重坐标。
- 按前缀或自上下文动态重新计算向量几乎不改变向量,且未比静态向量提升性能。
研究结果表明,坐标身份与排序幅度之间的相互作用对于转向成功至关重要,这挑战了关于哪些向量组件驱动模型行为的假设。