ntrillard 证明,将 K 和 V 缓存值的傅里叶幅度谱量化为 4 位,同时以全精度保留相位,在 Gemma-3-1B 上相对于 fp16 参考实现了 96.9% 的 token 匹配率,相比标准 min-max 量化提升了 5-10 倍。

  • Fmag4(4 位幅度 + 全精度相位)与 bf16 相比,实现了 96.9% 的 token 匹配率和 62% 的内存节省。
  • 在相同的提示词上,标准 4 位量化仅达到 54.9% 的 token 匹配率。
  • 该方法在不增加总内存预算的情况下,将 Qwen2.5-7B 在 10GB GPU 上的最大上下文长度从 68K 翻倍至 137K。
  • 相位被确定为结构信息的主要载体,而幅度谱则平滑且可压缩。

这种方法允许用户通过利用傅里叶变换实现更高效的 KV 缓存存储,在固定的硬件约束下显著扩展上下文窗口。