llama.cpp प्रोजेक्ट ने b11362 बिल्ड जारी किया, जिसमें F16 की-वैल्यू (KV) स्टोरेज का समर्थन करने वाला एक नया टेंसर API फ्लैश एटेंशन_kernel पेश किया गया है। यह अपडेट macOS, Linux, Windows, Android और iOS प्लेटफॉर्म पर उपलब्ध है, जिसमें CUDA, Vulkan और ROCm सहित विभिन्न बैकएंड विकल्प शामिल हैं।
- विशिष्ट आयामों के लिए टेंसर FA kernels जोड़े गए: DK=DV=512, DK=576/DV=512, और DK=192/DV=128।
- नया kernel एटेंशन sinks, ALiBi और लॉगिट सॉफ्टकैप तंत्र का समर्थन करता है।
- CPU, GPU (CUDA 12/13, Vulkan, ROCm 10.0) और NPU (Snapdragon Hexagon) बैकएंड के लिए पूर्व-निर्मित बाइनरी प्रदान किए गए हैं।
यह रिलीज समर्थित हार्डवेयर कॉन्फ़िगरेशन पर अधिक कुशल एटेंशन कंप्यूटेशन सक्षम बनाती है।