llama.cpp परियोजना ने संस्करण b10201 जारी किया है, जिसमें ggml-webgpu बैकएंड के लिए एक प्रमुख सुधार शामिल है। यह अपडेट लंबे संदर्भ जनरेशन के दौरान क्वांटाइज्ड की-वैल्यू कैश को संभालते समय flash attention प्रदर्शन में सुधार करता है।
- ggml-webgpu में क्वांटाइज्ड KV कैश के लिए flash attention वेक्टर प्रसंस्करण में सुधार।
- मान प्रकार जांच से संबंधित बग ठी किए गए और टिप्पणियाँ अपडेट की गईं।
- rebasing के कारण हुए बिल्ड त्रुटियों को हल किया गया।
- macOS (Apple Silicon, Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, HIP, OpenVINO, SYCL) और openEuler के लिए बाइनरी प्रदान की गईं।
यह रिलीज़ उपयोगकर्ताओं को लंबे अनुक्रमों के लिए अनुकूलित ध्यान तंत्र का लाभ उठाते हुए व्यापक हार्डवेयर प्लेटफ़ॉर्म पर llama.cpp चलाने की अनुमति देती है।