Причинное исследование логит-стерования по словарю на модели Qwen2-1.5B показывает, что самые крупные координаты в векторе стерования не обязательно отвечают за наблюдаемые поведенческие эффекты. Исследование, проведённое ntrillard, анализирует, как разреженное ранжированное логит-стерование влияет на генерацию токенов, и выявляет конкретные структурные компоненты, определяющие эти изменения.
- Транспортировка (генерация целевых слов) появляется при K≈150 и сохраняется до K≈300; точка K=200 является точкой максимальной согласованности, но не уникальным поведенческим оптимумом.
- Чистая проекция строки(W) (λ=1) показывает нулевую транспортировку на 30 семплах, тогда как каждое условие λ<1 сохраняет ненулевой компонент вне строки и демонстрирует некоторую транспортировку.
- Эффект определяется как лексическое принуждение, а не семантическая транспортировка; усиление топ-200 лексических соседей даёт 27/30 случаев транспортировки, тогда как неискусственно усиленные семантические соседи дают 0/30.
- Удаление единственной крупнейшей координаты не устраняет эффект, что указывает на отсутствие единой несущей координаты в векторе стерования.
- Динамическое пересчёт вектора для каждого префикса или собственного контекста едва меняет вектор и не улучшает производительность по сравнению со статическими векторами.
Результаты указывают на то, что взаимодействие между идентичностью координаты и её ранжированной величиной критически важно для успешного стерования, опровергая предположения о том, какие компоненты вектора определяют поведение модели.