أصدر مشروع llama.cpp الإصدار b11046، الذي يقدم دعمًا لـ OpenCL للنواة `flash_attn_f32_f16_bin`. يتضمن هذا التحديث أيضًا وظيفة الحشو المحمي (guarded prefill) لـ Flash Attention على أجهزة OpenCL.

  • تمت إضافة تنفيذ نواة `flash_attn_f32_f16_bin` لـ OpenCL.
  • تم تنفيذ منطق الحشو المحمي لـ Flash Attention في الخلفية (backend) الخاصة بـ OpenCL.
  • تم توفير ملفات ثنائية (binaries) لأنظمة macOS (Apple Silicon و Intel)، و Linux (CPU، CUDA، ROCm، Vulkan، SYCL، OpenVINO)، و Windows (CPU، CUDA، Vulkan، SYCL، ROCm، OpenVINO)، و Android، و iOS.

يوسع هذا الإصدار التوافق مع الأجهزة لآليات الانتباه (attention mechanisms) على الأجهزة القادرة على تشغيل OpenCL مع الحفاظ على دعم واسع عبر أنظمة التشغيل الرئيسية والمسرعات.