llama.cpp प्रोजेक्ट ने संस्करण b11140 जारी किया, जिसमें एक CUDA अनुकूलन शामिल है जो dsv4 prefill के लिए sparse-fa को सक्षम बनाता है। यह अपडेट flash attention मास्क स्कैनिंग प्रक्रिया में प्रदर्शन समस्याओं को कर्नेल को टेम्पलेट करके कंपाइल-टाइम लूप अनरोलिंग की अनुमति देकर हल करता है।

  • `flash_attn_mask_to_sparse_indices` का क्वेरी लूप अब कंपाइल-टाइम पर बाउंडेड है, जिससे 49k कॉलम के साथ स्पार्स डिकोड आकारों के लिए स्कैन समय 46 से घटकर 17 माइक्रोसेकंड हो गया है।
  • स्पार्स मास्क स्कैन के लिए आउट-ऑफ-बाउंड्स चेक को होस्ट कोड में स्थानांतरित कर दिया गया है, जिससे 49k संदर्भ पर बैच्ड स्पार्स ऑपरेशन का समय 586 से घटकर 244 माइक्रोसेकंड हो गया है।

यह रिलीज CPU, GPU और NPU बैकएंड्स के लिए macOS, Linux, Windows, Android और openEuler के लिए बाइनरी प्रदान करती है।