ntrillard démontre que la quantification du spectre de magnitude de Fourier des valeurs du cache K et V sur 4 bits, tout en préservant la phase à pleine précision, atteint une correspondance de tokens de 96,9 % par rapport à la référence fp16 sur Gemma-3-1B, soit une amélioration de 5 à 10 fois par rapport à la quantification min-max standard.
- Fmag4 (magnitude 4 bits + phase pleine précision) offre une correspondance de tokens de 96,9 % et des économies de mémoire de 62 % par rapport à bf16.
- La quantification 4 bits standard n'atteint qu'une correspondance de tokens de 54,9 % sur les mêmes prompts.
- La méthode double la longueur maximale du contexte, passant de 68K à 137K pour Qwen2.5-7B sur un GPU de 10 Go sans augmenter le budget mémoire total.
- La phase est identifiée comme le principal vecteur d'informations structurelles, tandis que le spectre de magnitude est lisse et compressible.
Cette approche permet aux utilisateurs d'étendre considérablement les fenêtres de contexte dans des contraintes matérielles fixes en exploitant la transformée de Fourier pour un stockage du cache KV plus efficace.