أصدر مشروع llama.cpp الإصدار b11140، الذي يتضمن تحسينًا لـ CUDA يمكّن استخدام sparse-fa لـ dsv4 prefill. يعالج هذا التحديث مشكلات الأداء في عملية مسح قناع flash attention من خلال نمذجة النوى للسماح بفتح الحلقات عند وقت الترجمة.
- تم تحديد نطاق حلقة الاستعلام الخاصة بـ `flash_attn_mask_to_sparse_indices` الآن عند وقت الترجمة، مما يقلل وقت المسح من 46 إلى 17 ميكروثانية لأشكال فك التشفير المتفرعة ذات الأعمدة الـ 49k.
- تم نقل فحوصات الخروج عن الحدود لمسح القناع المتفرع إلى كود المضيف، مما يسمح بانخفاض عملية المتفرعة المجمعة على سياق 49k من 586 إلى 244 ميكروثانية.
يوفر هذا الإصدار ملفات ثنائية لأنظمة macOS و Linux و Windows و Android و openEuler عبر خلفيات CPU و GPU و NPU.