llama.cpp प्रोजेक्ट ने संस्करण b11062 जारी किया है, जिसमें एक pull request शामिल है जो Qwen4 मॉडल के लिए sparse Flash Attention (FA) समर्थन को सक्षम करता है।
यह अद्यतन व्यापक b11062 रिलीज का हिस्सा है, जो CPU, GPU (CUDA, ROCm, Vulkan), और AI एक्सेलेरेटर बैकएंड्स के लिए macOS, Linux, Windows, Android, और openEuler के लिए बाइनरी प्रदान करता है।
रिलीज नोट्स में उल्लिखित विशिष्ट परिवर्तन Qwen4 के लिए sparse FA क्षमताओं को जोड़ता है ताकि दक्षता में सुधार किया जा सके।