ntrillard demonstra que quantizar o espectro de magnitude de Fourier dos valores de cache K e V para 4 bits, preservando a fase em precisão completa, alcança correspondência de tokens de 96,9% em relação à referência fp16 no Gemma-3-1B, uma melhoria de 5 a 10 vezes em comparação com a quantização padrão min-max.
- Fmag4 (magnitude de 4 bits + fase em precisão completa) resulta em correspondência de tokens de 96,9% e economia de memória de 62% em comparação com bf16.
- A quantização padrão de 4 bits alcança apenas 54,9% de correspondência de tokens nos mesmos prompts.
- O método dobra o comprimento máximo do contexto de 68K para 137K no Qwen2.5-7B em uma GPU de 10GB sem aumentar o orçamento total de memória.
- A fase é identificada como o principal portador de informações estruturais, enquanto o espectro de magnitude é suave e compressível.
Essa abordagem permite que os usuários estendam significativamente as janelas de contexto dentro de restrições de hardware fixas, aproveitando a transformada de Fourier para um armazenamento mais eficiente do cache KV.