llama.cpp प्रोजेक्ट ने संस्करण b10839 जारी किया, जिसने टेंसर पंक्ति पुनर्प्राप्ति संचालनों के दौरान असंगत ऑफ़सेट के कारण Vulkan बैकएंड में होने वाले कठोर क्रैश को हल किया। पहले, Qwen3-TTS और Qwen3-VL जैसे मॉडल्स `ggml_view` का उपयोग करते समय शून्येतर दृश्य ऑफ़सेट के साथ विफल हो जाते थे क्योंकि शेडर `minStorageBufferOffsetAlignment` के सापेक्ष संरेखण उल्लंघनों पर एक्सर्ट करता था। यह अपडेट क्वांटाइज्ड और अ-क्वांटाइज्ड दोनों पथों में संरेखित ऑफ़सेट के लिए नेटिव समर्थन लागू करता है, जिससे CPU फॉलबैक की आवश्यकता समाप्त हो जाती है।

मुख्य तकनीकी परिवर्तन शामिल हैं:

  • दृश्य ऑफ़सेट के पास एक संरेखित स्थिति पर बफ़र ऑफ़सेट को बाइंड करना और ट्रंकेशन त्रुटियों से बचने के लिए पुश कॉन्स्टेंट्स के माध्यम से समायोजित असंगति पारित करना।
  • UMA और डिस्क्रीट GPU दोनों पर भौतिक ऑफ़सेट को सही ढंग से संभालने के लिए `ggml_vk_tensor_subbuffer` में एक `use_view_offs` पैरामीटर जोड़ना।
  • स्टोरेज बफ़र संरेखण आवश्यकताओं को पूरा करने वाले सबसे छोके वैध असंगति को खोजने के लिए `ggml_vk_get_adjusted_misalign` पेश करना।
  • Vulkan बैकएंड अब इन मामलों को नेटिव रूप से संभाल लेता है, इसलिए `supports_op()` में पिछला रक्षात्मक CPU फॉलबैक हटा दिया गया।
  • कई डेटा प्रकारों पर शून्येतर दृश्य ऑफ़सेट के लिए व्यापक बैकएंड परीक्षण कवरेज जोड़ना, जिसमें NVIDIA RTX 5060 Ti पर सभी 223 GET_ROWS परीक्षण सफल हुए।

यह ठीक Vulkan हार्डवेयर पर जटिल टेंसर दृश्यों और KV कैश स्लाइस पर निर्भर मॉडल्स के स्थिर निष्पादन को सुनिश्चित करता है, जिसके लिए CPU ऑफ़लोडिंग की आवश्यकता नहीं होती।