llama.cpp प्रोजेक्ट ने बिल्ड b10517 जारी किया, जिसमें flash attention (FA) डीक्वांटाइज़ेशन पथ के लिए Vulkan-विशिष्ट कई सुधार शामिल हैं। मुख्य बदलावों में coopmat1 में q8_0 KV को एक बार डीक्वांट करना, coopmat2 पर FA डीक्वांट पथ को छोड़ना, और Intel Xe1 को FA डीक्वांट पथ से बाहर करना शामिल है।

  • जब FA scratch maxStorageBufferRange से अधिक हो जाता है, तो Vulkan अब रद्द करने के बजाय fallback करता है।
  • रिलीज़ में FA डीक्वांट पथ में एक विशिष्ट KV-cache लेआउट की आवश्यकता होती है।
  • FA पथ के लिए कसकर permutation जाँचें की गईं और prealloc_x_need_sync टाइमिंग को ठीक किया गया।
  • contiguously-allocated K/V FA परिदृश्यों के लिए परीक्षण जोड़े गए।

यह अपडेट मेमोरी प्रबंधन और हार्डवेयर संगतता में edge cases को संबोधित करके Vulkan उपयोगकर्ताओं के लिए स्थिरता और प्रदर्शन को बढ़ावा देता है।