llama.cpp b11224 रिलीज में Vulkan बैकएंड में मैट्रिक्स गुणा ऑपरेशन जब KV caches जैसे बड़े, strided टेन्सर के स्लाइस पढ़ते हैं तो गलत कंप्यूटेशन परिणामों को संबोधित करता है।
- in-place src0 और src1 टेन्सर के लिए बैच stride अब ne00*ne01 के बजाय nb[2] से सही रूप से व्युत्पन्न होता है, जिससे सभी heads में पंक्तियों का उचित एक्सेस सुनिश्चित होता है।
- ggml_nbytes या ggml_vk_subbuffer का उपयोग करके strided extent द्वारा in-place A और B रेंज को आकार दिया जाता है ताकि बिना coopmat2 के NVIDIA हार्डवेयर पर शून्य किए गए डेटा को पढ़ने या लटकने से बचाया जा सके।
- mul_mat_id और mul_mm मार्गों को strided विशेषज्ञ views और आंशिक टाइल्स को सही रूप से संभालने के लिए अपडेट किया गया है, जिससे NVFP4 ऑपरेशन पर लटकने से बचा जाता है।
यह फिक्स Vulkan बैकएंड में strided मेमोरी लेआउट पर निर्भर डिकोडर self-attention तंत्र के लिए सटीक इनफरेंस परिणाम सुनिश्चित करता है।