أضاف مشروع llama.cpp دعم نواة Flash Attention (FA) للتكوين المحدد المستخدم بواسطة MiniCPM3 على Apple Silicon. يعالج هذا التغيير تعطلًا حيث كان العلم `-fa auto` يتوقف بسبب عدم وجود تثبيت للنواة لطول مفتاح الانتباه 96 وطول القيمة 64.
- تمت إضافة نوى البلاط عند (96, 64) لكل نوع K/V يدعم بالفعل (96, 96).
- تمت إضافة نوى vec لتكوينات NE=4، لأن هذا هو القيمة الوحيدة حيث يقسم NL كلًا من DK/4 و DV/4.
- تم تحديث الاختبارات لتجنب التغطية المكررة لشريحة vec FA.
يتيح هذا التحديث تشغيل نماذج MiniCPM3 مع تمكين Flash Attention على أجهزة macOS و iOS دون encountering أخطاء النواة.