أصدر مشروع llama.cpp الإصدار b11062، والذي يتضمن طلب سحب (pull request) لتمكين دعم الانتباه السريع (Flash Attention - FA) المتناثر لنموذج Qwen4.

يُعد هذا التحديث جزءًا من إصدار b11062 الأوسع نطاقًا، الذي يوفر ملفات ثنائية لأنظمة macOS وLinux وWindows وAndroid وopenEuler عبر وحدات المعالجة المركزية (CPU) ووحدات معالجة الرسومات (GPU) (CUDA وROCm وVulkan) ومسرعات الذكاء الاصطناعي.

يضيف التغيير المحدد المذكوم في ملاحظات الإصدار قدرات FA المتناثر لـ Qwen4 لتحسين الكفاءة.