llama.cpp परियोजना ने बिल्ड b10835 जारी किया है, जिसमें f16 flash attention के लिए ggml-cda कार्यान्वयन में एक विचलित बाधा समस्या के लिए सुधार शामिल है। यह अपडेट उसी मॉड्यूल में डुप्लिकेट मेटाडाटा पॉइंटर सेटअप को भी संबोधित करता है।
- ggml-cuda f16 flash attention में विचलित बाधा को ठीक करता है (PR #27870)।
- ggml-cuda में डुप्लिकेट मेटाडाटा पॉइंटर सेटअप को रोकता है।
यह रिलीज़ CUDA, Vulkan, ROCm और SYCL सहित विभिन्न CPU और GPU बैकएंड के लिए macOS, Linux, Windows, Android और openEuler के लिए अद्यतन बाइनरी प्रदान करती है।