llama.cpp प्रोजेक्ट ने बिल्ड b10905 जारी किया, जिसमें gfx1201 आर्किटेक्चर पर CUDA/HIP के लिए Flash Attention का विशिष्ट ट्यूनिंग शामिल है। यह अपडेट AMD RDNA4 GPUs के लिए प्रदर्शन को अनुकूलित करने पर केंद्रित है।
- HIP: RDNA4 पर head size 256 के लिए म्याट्रिक्स गुणा-त्वरित (mma) Flash Attention सक्षम करता है और संबंधित कॉन्फ़िगरेशन को ट्यून करता है।
- HIP: AMD WMMA आर्किटेक्चर पर stream-k के बजाय whole-tile Flash Attention ग्रिड्स को प्राथमिकता देता है।
- निष्पादन प्रवाह को बेहतर बनाने के लिए stream_k तर्क की समीक्षा की गई।
- बेहतर हार्डवेयर टारगेटिंग के लिए kernel चयन तर्क की समीक्षा की गई।
रिलीज में CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL और OpenCL सहित विभिन्न बैकएंड्स के माध्यम से macOS, Linux, Windows, Android और openEuler के लिए बाइनरी प्रदान करता है।