أصدر مشروع llama.cpp الإصدار b10905، والذي يتضمن ضبطًا محددًا لـ Flash Attention لـ CUDA/HIP على بنية gfx1201. يركز هذا التحديث على تحسين الأداء لوحدة معالجة الرسومات AMD RDNA4.

  • HIP: يمكّن Flash Attention المعجّل بالضرب المصفوفي (mma) لحجم الرأس 256 على RDNA4 ويضبط التكوينات المرتبطة.
  • HIP: يفضل شبكات Flash Attention الكاملة للمosaic بدلاً من stream-k على بنية AMD WMMA.
  • تمت مراجعة منطق stream_k لتحسين تدفق التنفيذ.
  • تمت مراجعة منطق اختيار النواة لاستهداف الأجهزة بشكل أفضل.

يوفر الإصدار ملفات ثنائية (binaries) لأنظمة macOS و Linux و Windows و Android و openEuler عبر خلفيات متعددة بما في ذلك CPU و CUDA و ROCm و Vulkan و OpenVINO و SYCL و OpenCL.