llama.cpp परियोजना ने बिल्ड b10165 जारी किया है, जो Flash Attention (FA) Vulkan बैकएंड के लिए iq4_nl क्वांटीज़ेशन समर्थन को पुनर्स्थापित करता है। साझा मेमोरी उपयोग के बारे में चिंताओं को नगण्य माने जाने के बाद इस बदलाव ने #23681 मुद्दे को हल किया है, जिसमें सुविधा को फिर से सक्षम किया गया है।

  • Vulkan FA कार्यान्वयन में iq4_nl समर्थन वापस जोड़ा गया है।
  • non-coopmat2 विन्यासों के लिए q1_0 समर्थन जोड़ा गया है।
  • q1_0 FA समर्थन के हटाने से संबंधित GitHub मुद्दा #23681 ठीक किया गया है।

रिलीज़ CPU, CUDA, ROCm, OpenVINO, SYCL, और Vulkan बैकएंड्स के लिए macOS, Linux, Windows, और Android के लिए बाइनरी प्रदान करती है।