llama.cpp प्रोजेक्ट ने Apple Silicon पर MiniCPM3 द्वारा उपयोग की जाने वाली विशिष्ट कॉन्फ़िगरेशन के लिए Flash Attention (FA) kernel समर्थन जोड़ा है। यह बदलाव एक क्रैश को ठीक करता है जहां `-fa auto` फ्लैग ध्यान कुंजी लंबाई 96 और मान लंबाई 64 के लिए गायब kernel instantiation के कारण विफल हो जाता था।

  • उन प्रत्येक K/V प्रकार के लिए (96, 64) पर tile kernels जोड़े गए जो पहले से ही (96, 96) का समर्थन करते हैं।
  • NE=4 कॉन्फ़िगरेशन के लिए vec kernels जोड़े गए, क्योंकि यह एकमात्र मान है जहां NL DK/4 और DV/4 दोनों को विभाजित करता है।
  • अनावश्यक FA vec slice कवरेज से बचने के लिए टेस्ट अपडेट किए गए।

इस अपडेट से MiniCPM3 मॉडल macOS और iOS डिवाइस पर Flash Attention सक्षम करके बिना kernel त्रुटियों के चलाए जा सकते हैं।