Qwen2-1.5Bモデルにおける語彙-ロジット制御の因果調査により、制御ベクトル内の最大の座標が必ずしも観察された行動効果の原因ではないことが明らかになった。ntrillardによって行われたこの研究は、スパースランク付きロジット制御がトークン生成に与える影響を分析し、これらの変化を引き起こす特定の構造的要素を特定した。

  • 輸送(対象語の生成)はK≈150付近で現れ、K≈300まで持続する。K=200は最大整合点ではあるが、一意の行動的最適解ではない。
  • 純粋な行(W)射影(λ=1)では30回のシード全体で輸送がゼロとなる一方、すべてのλ<1条件では行外成分が非ゼロであり、何らかの輸送が見られる。
  • この効果は意味的輸送ではなく語彙的強制として特定された。トップ200の語彙的近傍語を増強すると30回中27回で輸送が生じるが、増強なしの意味的近傍語では30回中0回であった。
  • 最大の座標を1つ削除しても効果は消滅せず、制御ベクトルに単一の荷重支持座標が存在しないことを示している。
  • プレフィックスまたは自己コンテキストごとにベクトルを動的に再計算すると、ベクトルはほとんど変化せず、静的ベクトルに対して性能向上もみられない。

これらの知見は、座標の同一性とランク付き大きさの相互作用が制御の成功にとって重要であることを示唆し、モデルの行動を引き起こすベクトル成分に関する仮定に疑問を投げかける。