يعالج إصدار llama.cpp b11224 نتائج الحساب غير الصحيحة في واجهة Vulkan الخلفية عندما تقرأ عمليات ضرب المصفوفات شرائح من موترات أكبر وذات خطوة، مثل ذاكرات التخزين المؤقت KV.
- يتم اشتقاق خطوة الدفعة للموترات src0 و src1 في المكان الآن بشكل صحيح من nb[2] بدلاً من ne00*ne01، مما يضمن الوصول الصحيح إلى الصفوف عبر جميع الرؤوس.
- يتم تحديد نطاقات A و B في المكان بناءً على امتدادها ذو الخطوة باستخدام ggml_nbytes أو ggml_vk_subbuffer لمنع قراءة البيانات الممسوحة أو التعليق على عتاد NVIDIA بدون coopmat2.
- تم تحديث مسارات mul_mat_id و mul_mm للتعامل بشكل صحيح مع مشاهد الخبراء ذات الخطوة والبلاط الجزئي، مما يتجنب التعليق في عمليات NVFP4.
يضمن هذا الإصلاح نتائج استنتاج دقيقة لآليات الانتباه الذاتي للمفسر التي تعتمد على تخطيطات الذاكرة ذات الخطوة في واجهة Vulkan الخلفية.