llama.cpp परियोजना ने बिल्ड b11043 जारी किया, जिसमें HMX flash-attention कार्यान्वयन में एक बदलाव शामिल है। यह अपडेट 64 के गुणक न होने वाले head dimensions का समर्थन सक्षम करता है, विशेष रूप से SigLIP के head_dim=72 जैसी विन्यासों की अनुमति देता है।
- HMX flash-attention kernel अब DK/DV को 64 तक राउंड अप करके शून्य-भरे tail lanes के साथ काम करता है।
- macOS (Apple Silicon और Intel), iOS, Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android, और openEuler के लिए पूर्व-निर्मित बाइनरी उपलब्ध हैं।
यह बदलाव उपयोगकर्ताओं को समर्थित हार्डवेयर पर गैर-मानक head dimensions वाले मॉडल चलाने की अनुमति देता है, बिना संगतता समस्याओं के।