ntrillard demonstra que quantizar o espectro de magnitude de Fourier dos valores de cache K e V para 4 bits, preservando a fase em precisão completa, alcança correspondência de tokens de 96,9% em relação à referência fp16 no Gemma-3-1B, uma melhoria de 5 a 10 vezes em comparação com a quantização padrão min-max.

  • Fmag4 (magnitude de 4 bits + fase em precisão completa) resulta em correspondência de tokens de 96,9% e economia de memória de 62% em comparação com bf16.
  • A quantização padrão de 4 bits alcança apenas 54,9% de correspondência de tokens nos mesmos prompts.
  • O método dobra o comprimento máximo do contexto de 68K para 137K no Qwen2.5-7B em uma GPU de 10GB sem aumentar o orçamento total de memória.
  • A fase é identificada como o principal portador de informações estruturais, enquanto o espectro de magnitude é suave e compressível.

Essa abordagem permite que os usuários estendam significativamente as janelas de contexto dentro de restrições de hardware fixas, aproveitando a transformada de Fourier para um armazenamento mais eficiente do cache KV.