أصدر مشروع llama.cpp الإصدار b10899، مقدمًا تحسينات أداء محددة في الخلفية الخاصة بـ Vulkan. يركز التحديث على تحسين عمليات المصفوفات لعائلة نماذج Qwen وتعزيز الأداء العام مع قيم M الصغيرة.

  • يحسّن mul_mat عند m=1 عن طريق تبديل مصفوفات A/B في Vulkan.
  • يحسّن الأداء للأبعاد الصغيرة لـ M.
  • يمكّن دعم split_k مع قيم M الصغيرة.
  • يضبط اختيار البلاط الصغير مقابل المتوسط لـ coopmat2 ليكون اعتمادًا على M بدلاً من N فقط.

تهدف هذه التغييرات إلى تحسين كفاءة الاستدلال على الأجهزة المتوافقة مع Vulkan، خاصةً للنماذج مثل Qwen التي تستفيد من تحسينات المصفوفات المحددة.