ntrillard demuestra que cuantificar el espectro de magnitud de Fourier de los valores del caché K y V a 4 bits, mientras se preserva la fase con precisión completa, logra un 96,9 % de coincidencia de tokens con la referencia fp16 en Gemma-3-1B, una mejora de 5 a 10 veces respecto a la cuantización estándar min-max.

  • Fmag4 (magnitud de 4 bits + fase de precisión completa) produce un 96,9 % de coincidencia de tokens y un ahorro del 62 % de memoria en comparación con bf16.
  • La cuantización estándar a 4 bits logra solo un 54,9 % de coincidencia de tokens en los mismos prompts.
  • El método duplica la longitud máxima del contexto de 68K a 137K para Qwen2.5-7B en una GPU de 10GB sin aumentar el presupuesto total de memoria.
  • La fase se identifica como el principal portador de información estructural, mientras que el espectro de magnitud es suave y compresible.

Este enfoque permite a los usuarios extender significativamente las ventanas de contexto dentro de las limitaciones de hardware fijas aprovechando la transformada de Fourier para un almacenamiento del caché KV más eficiente.