llama.cpp b11463 रिलीज़ में एक SYCL अपडेट शामिल है जो GLM-4.7 Flash की विशिष्ट Multi-Latent Attention (MLA) आकार के लिए MKL flash attention को सक्षम बनाता है, जिसे पहले डिस्पैचर द्वारा अस्वीकार कर दिया गया था।
- परिवर्तन 576/576/512 GQA-20 F16 आकार को MKL पाइपलाइन में स्वीकार करता है और V cache को K पंक्तियों के एक strided view के रूप में संभालता है।
- मेमोरी ट्रैफ़िक कम करने के लिए MKL flash attention स्कोर को F16 में संग्रहीत करने का प्रयास शामिल था, लेकिन बाद में इस बिल्ड में वापस ले लिया गया।
- एक Intel Arc Pro B70 पर, MLA अनुकूलन ने प्रॉम्प्ट प्रोसेसिंग (pp8192) को 432.80 से 1292.29 tok/s तक बढ़ाया, जो कि 2.99x की गति वृद्धि है।
- रिलीज़ CPU, CUDA, ROCm, Vulkan, OpenVINO और SYCL बैकएंड्स के लिए macOS, Linux, Windows, Android और openEuler के लिए बाइनरी प्रदान करती है।