أصدر مشروع llama.cpp الإصدار b10899، مقدمًا تحسينات أداء محددة في الخلفية الخاصة بـ Vulkan. يركز التحديث على تحسين عمليات المصفوفات لعائلة نماذج Qwen وتعزيز الأداء العام مع قيم M الصغيرة.
- يحسّن mul_mat عند m=1 عن طريق تبديل مصفوفات A/B في Vulkan.
- يحسّن الأداء للأبعاد الصغيرة لـ M.
- يمكّن دعم split_k مع قيم M الصغيرة.
- يضبط اختيار البلاط الصغير مقابل المتوسط لـ coopmat2 ليكون اعتمادًا على M بدلاً من N فقط.
تهدف هذه التغييرات إلى تحسين كفاءة الاستدلال على الأجهزة المتوافقة مع Vulkan، خاصةً للنماذج مثل Qwen التي تستفيد من تحسينات المصفوفات المحددة.