تقدم إصدار llama.cpp b10728 تنفيذًا لـ CUDA لـ XOR swizzle على بلاط fp16 للذاكرة المشتركة K,V الخاصة بـ Flash Attention. يحل هذا التحديث أيضًا حالة سباق الذاكرة المشتركة في Flash Attention على عتاد DGX Spark.
- ينفذ flash attention مع XOR swizzle وبلاط fp16 لـ CUDA.
- يصلح استخدام مؤشر عام 64 بت بدلاً من مؤشر مشترك 32 بت.
- يضيف حالات اختبار لـ swizzle ويقيّد المزامنة على مسار swizzled فقط.
- يسمح بـ swishing للأشكال غير القوى للرقم 2 حيث nbatch_2%32==0.
- يعيد هيكلة منطق ldmatrix الخاص بـ swizzle في Flash Attention إلى وظائف مساعدة.
يوفر الإصدار ملفات ثنائية لـ macOS و Linux و Windows و Android و openEuler عبر الخلفيات CPU و CUDA و Vulkan و ROCm و OpenVINO و SYCL.