Um preprint intitulado "Steer on a Sphere: Geometric Control of Transformer Outputs" analisa a geometria dos estados ocultos do Transformer, descobrindo que eles residem em uma esfera definida pela escala RMSNorm por camada, em vez do tamanho da dimensão. Este raio varia significativamente entre arquiteturas, como DeepSeek-7B e Mistral-7B.

As principais descobertas incluem a travessia tangencial, onde um passo ao longo de uma direção LM-head atinge 91–98% do rank 1 do vocabulário, e o "cow tipping", onde tokens específicos atuam como pontos fixos auto-reforçantes que causam repetição infinita. O trabalho também identifica vulnerabilidades de codificação defensiva usando gatilhos como bytes NULL e nota o agrupamento da taxa de Lyapunov perto de 0.5 para várias arquiteturas.

O autor apresenta essas propriedades geométricas para explicar comportamentos específicos do Transformer, como o bloqueio de tokens e implicações potenciais de segurança para scrapers, enquanto observa que a imagem geométrica é aproximada.