llama.cpp प्रोजेक्ट ने संस्करण b10532 जारी किया, जिसमें Metal बैकएंड पर एक पूर्व-प्रसंस्करण पास शामिल है जो Flash Attention निष्पादित करने से पहले क्वांटाइज्ड की-वैल्यू (KV) कैश को F16 में डीक्वांटाइज़ करता है।
- नया केर्नल Q8_0 KV टेंसर को एक सतत F16 स्क्रैच बफर में डीक्वांटाइज़ करता है, जिससे इन-केर्नल डीक्वांटीज़ेशन के बजाय मौजूदा F16 Flash Attention केर्नल का उपयोग किया जा सकता है।
- समर्थन को Metal द्वारा समर्थित सभी क्वांटाइज्ड KV प्रकारों तक विस्तारित किया गया, जिसमें Q4_0, Q4_1, Q5_0 और Q5_1 शामिल हैं।
- MLA-आधारित मॉडल्स के लिए जहाँ V, K का एक व्यू है, कार्यान्वयन अनावश्यक V डीक्वांटीज़ेशन को छोड़ देता है और V को K F16 बफर से पढ़ता है।
- M2 Ultra पर सत्यापन ने दिखाया कि q8_0 KV के साथ Qwen2.5-0.5B का perplexity, F16 संदर्भ के साथ बिल्कुल मेल खाता है (PPL 1.0008)।
यह परिवर्तन क्वांटाइज्ड KV कैश के लिए सतत F16 बफर का लाभ उठाकर Metal डिवाइसों पर कुशल Flash Attention निष्पादन को सक्षम बनाता है, जो मानक F16 कार्यान्वयनों के साथ सटीकता की समानता सुनिश्चित करता है।