يتضمن إصدار llama.cpp b11463 تحديثًا لـ SYCL يمكّن من استخدام MKL flash attention للشكل المحدد لـ Multi-Latent Attention (MLA) الخاص بـ GLM-4.7 Flash، والذي كان مرفوضًا سابقًا بواسطة الموزع.
- يقبل التغيير شكل 576/576/512 GQA-20 F16 في خط أنابيب MKL ويعالج V cache كعرض متدرج لصفوف K.
- شمل محاولة لتخزين نتائج MKL flash attention بتنسيق F16 لتقليل حركة مرور الذاكرة، ولكن تم التراجع عنها لاحقًا في هذا البناء.
- على جهاز Intel Arc Pro B70، حسّنت تحسين MLA معالجة الطلب (pp8192) من 432.80 إلى 1292.29 tok/s، مما يمثل تسريعًا بنسبة 2.99x.
- يوفر الإصدار ملفات ثنائية لنظامي macOS وLinux وWindows وAndroid وopenEuler عبر الخلفيات CPU وCUDA وROCm وVulkan وOpenVINO وSYCL.