llama.cpp प्रोजेक्ट ने संस्करण b10615 जारी किया, जिसमें Metal बैकएंड के लिए per-device tuned quantized (Q, NE) flash-attention वेक्टर ऑपरेशन शामिल हैं।

  • 53 f16 flash-attn वेक्टर इंस्टेंशियल जोड़े गए, कुल संख्या 80 से बढ़कर 133 हो गई।
  • shared memory capacity fallback के साथ एक tuning table और dispatch wiring लागू किया गया।
  • quantized KV caches का समर्थन करने के लिए वेक्टर ट्यूनिंग को विस्तारित किया गया।
  • M1 Pro, M2 Ultra, और M5 Max डिवाइसों के लिए tuned पैरामीटर शामिल किए गए।

यह अपडेट Apple Silicon हार्डवेयर पर विशिष्ट tuning परिणामों को Metal बैकएंड पर लागू करके प्रदर्शन को अनुकूलित करता है।