llama.cpp परियोजना ने बिल्ड b10165 जारी किया है, जो Flash Attention (FA) Vulkan बैकएंड के लिए iq4_nl क्वांटीज़ेशन समर्थन को पुनर्स्थापित करता है। साझा मेमोरी उपयोग के बारे में चिंताओं को नगण्य माने जाने के बाद इस बदलाव ने #23681 मुद्दे को हल किया है, जिसमें सुविधा को फिर से सक्षम किया गया है।
- Vulkan FA कार्यान्वयन में iq4_nl समर्थन वापस जोड़ा गया है।
- non-coopmat2 विन्यासों के लिए q1_0 समर्थन जोड़ा गया है।
- q1_0 FA समर्थन के हटाने से संबंधित GitHub मुद्दा #23681 ठीक किया गया है।
रिलीज़ CPU, CUDA, ROCm, OpenVINO, SYCL, और Vulkan बैकएंड्स के लिए macOS, Linux, Windows, और Android के लिए बाइनरी प्रदान करती है।