llama.cpp परियोजना ने संस्करण b11046 जारी किया, जिसने `flash_attn_f32_f16_bin` kernel के लिए OpenCL समर्थन पेश किया। इस अपडेट में OpenCL उपकरणों पर Flash Attention के लिए सुरक्षित prefill कार्यक्षमता भी शामिल है।

  • OpenCL के लिए `flash_attn_f32_f16_bin` kernel कार्यान्वयन जोड़ा गया।
  • OpenCL backend में Flash Attention के लिए सुरक्षित prefill तर्क लागू किया गया।
  • macOS (Apple Silicon और Intel), Linux (CPU, CUDA, ROCm, Vulkan, SYCL, OpenVINO), Windows (CPU, CUDA, Vulkan, SYCL, ROCm, OpenVINO), Android, और iOS के लिए बाइनरी प्रदान किए गए।

यह रिलीज OpenCL-सक्षम उपकरणों पर ध्यान तंत्रों के लिए हार्डवेयर संगतता को बढ़ाती है, जबकि प्रमुख ऑपरेटिंग सिस्टम और एक्सेलेरेटर across व्यापक समर्थन बनाए रखती है।