ntrillard दिखाते हैं कि K और V कैश मानों के फूरियर मैग्निट्यूड स्पेक्ट्रम को 4-बिट में क्वांटीज़ करते हुए, पूर्ण परिशुद्धता में चरण को बनाए रखने से fp16 संदर्भ पर Gemma-3-1B के लिए 96.9% टोकन मिलान प्राप्त होता है, जो मान्य न्यूनतम-अधिकतम क्वांटीकरण की तुलना में 5-10 गुना बेहतर है।
- Fmag4 (4-बिट मैग्निट्यूड + पूर्ण परिशुद्धता चरण) bf16 की तुलना में 96.9% टोकन मिलान और 62% मेमोरी बचत प्रदान करता है।
- मान्य 4-बिट क्वांटीकरण समान प्रॉम्प्ट्स पर केवल 54.9% टोकन मिलान प्राप्त करता है।
- इस विधि से 10GB GPU पर Qwen2.5-7B के लिए अधिकतम संदर्भ लंबाई को 68K से बढ़ाकर 137K किया जाता है, बिना कुल मेमोरी बजट में वृद्धि किए।
- चरण को संरचनात्मक जानकारी का प्राथमिक वाहक माना गया है, जबकि मैग्निट्यूड स्पेक्ट्रम चिकना और संपीड़न योग्य है।
यह दृष्टिकोण उपयोगकर्ताओं को अधिक कुशल केवी कैश भंडारण के लिए फूरियर रूपांतरण का लाभ उठाते हुए, निश्चित हार्डवेयर प्रतिबंधों के भीतर संदर्भ विंडो को महत्वपूर्ण रूप से बढ़ाने की अनुमति देता है।