أصدر مشروع llama.cpp الإصدار b10905، والذي يتضمن ضبطًا محددًا لـ Flash Attention لـ CUDA/HIP على بنية gfx1201. يركز هذا التحديث على تحسين الأداء لوحدة معالجة الرسومات AMD RDNA4.
- HIP: يمكّن Flash Attention المعجّل بالضرب المصفوفي (mma) لحجم الرأس 256 على RDNA4 ويضبط التكوينات المرتبطة.
- HIP: يفضل شبكات Flash Attention الكاملة للمosaic بدلاً من stream-k على بنية AMD WMMA.
- تمت مراجعة منطق stream_k لتحسين تدفق التنفيذ.
- تمت مراجعة منطق اختيار النواة لاستهداف الأجهزة بشكل أفضل.
يوفر الإصدار ملفات ثنائية (binaries) لأنظمة macOS و Linux و Windows و Android و openEuler عبر خلفيات متعددة بما في ذلك CPU و CUDA و ROCm و Vulkan و OpenVINO و SYCL و OpenCL.