ntrillard menunjukkan bahwa mengkuantisasi spektrum magnitudo Fourier dari nilai cache K dan V ke 4-bit sambil mempertahankan fase pada presisi penuh mencapai pencocokan token sebesar 96,9% dengan referensi fp16 pada Gemma-3-1B, peningkatan 5-10 kali lipat dibandingkan kuantisasi min-max standar.
- Fmag4 (magnitudo 4-bit + fase presisi penuh) menghasilkan pencocokan token 96,9% dan penghematan memori sebesar 62% dibandingkan bf16.
- Kuantisasi 4-bit standar hanya mencapai pencocokan token sebesar 54,9% pada prompt yang sama.
- Metode ini menggandakan panjang konteks maksimum dari 68K menjadi 137K untuk Qwen2.5-7B pada GPU 10GB tanpa meningkatkan total anggaran memori.
- Fase diidentifikasi sebagai pembawa utama informasi struktural, sementara spektrum magnitudo halus dan dapat dikompresi.
Pendekatan ini memungkinkan pengguna memperluas jendela konteks secara signifikan dalam batasan perangkat keras tetap dengan memanfaatkan transformasi Fourier untuk penyimpanan cache KV yang lebih efisien.