llama.cpp प्रोजेक्ट ने बिल्ड b11111 जारी किया, जिसमें Xe-LPG Plus, Xe2, और Xe3 आर्किटेक्चर पर split k पथों के लिए Vulkan-आधारित flash attention ऑप्टिमाइजेशन kernels शामिल हैं।
- Vulkan में split k पथ के लिए Intel FA kernel ऑप्टिमाइजेशन जोड़ा गया।
- split k FA kernel पथ चयन को संभालने के लिए host code अपडेट किया गया।
- flash_attn_decode_phase_1 shader में सममित coopMatMulAdd() का उपयोग करके A770 Linux ऑपरेटर टेस्ट विफलताओं को ठीक किया गया।
- flash_attn_decode_phase_2.comp फ़ाइल में editorconfig समस्याएं हल की गईं।
यह अपडेट Intel Arc GPUs के लिए अनुकूलित inference क्षमताएं प्रदान करता है और Linux सिस्टम पर विशिष्ट ड्राइवर संगतता समस्याओं को हल करता है।