Препринт под названием "Steer on a Sphere: Geometric Control of Transformer Outputs" анализирует геометрию скрытых состояний трансформера, обнаруживая, что они находятся на сфере, определяемой масштабом RMSNorm каждого слоя, а не размером измерения. Этот радиус значительно варьируется между архитектурами, такими как DeepSeek-7B и Mistral-7B.
Ключевые выводы включают тангенциальное перемещение, где один шаг вдоль направления LM-head достигает 91–98% от ранга 1 словаря, и «повал коровы», при котором определенные токены действуют как самоподкрепляющиеся фиксированные точки, вызывая бесконечное повторение. Работа также выявляет уязвимости защитного кодирования с использованием триггеров, таких как нулевые байты, и отмечает кластеризацию скорости Ляпунова около 0.5 для нескольких архитектур.
Автор представляет эти геометрические свойства, чтобы объяснить конкретное поведение трансформера, такое как блокировка токенов и потенциальные последствия для безопасности скрейперов, отмечая при этом, что геометрическая картина является приблизительной.