llama.cpp परियोजना ने संस्करण b10899 जारी किया, जिसने अपने Vulkan बैकएंड में विशिष्ट प्रदर्शन सुधार पेश किए। अपडेट का ध्यान Qwen मॉडल परिवार के लिए मैट्रिक्स ऑपरेशन को अनुकूलित करने और छोटे M के लिए सामान्य प्रदर्शन बढ़ाने पर केंद्रित है।

  • Vulkan में A/B मैट्रिक्स को बदलकर m=1 mul_mat को अनुकूलित करता है।
  • छोटे M आयामों के लिए प्रदर्शन में सुधार करता है।
  • छोटे M मानों के साथ split_k समर्थन सक्षम करता है।
  • coopmat2 के लिए छोटे vs. मध्यम टाइल चयन को N की बजाय M पर निर्भर होने के लिए समायोजित करता है।

ये परिवर्तन Vulkan-संगत हार्डवेयर पर निष्पादन दक्षता को बेहतर बनाने का लक्ष्य रखते हैं, विशेष रूप से Qwen जैसे मॉडलों के लिए जो विशिष्ट मैट्रिक्स अनुकूलनों से लाभान्वित होते हैं।