أصدر مشروع llama.cpp الإصدار b11043، الذي يتضمن تغييرًا في تنفيذ HMX flash-attention. يتيح هذا التحديث دعم أبعاد الرأس التي ليست مضاعفات للرقم 64، مما يسمح تحديدًا بإعدادات مثل head_dim=72 الخاص بـ SigLIP.

  • يعمل نواة flash-attention الخاصة بـ HMX الآن على DK/DV مقربة لأعلى إلى 64 مع قنوات ذيلية مملوءة بالصفر.
  • تتوفر ثنائيات جاهزة لـ macOS (Apple Silicon و Intel)، iOS، Linux (CPU، Vulkan، CUDA، ROCm، OpenVINO، SYCL)، Windows (CPU، OpenCL، CUDA، Vulkan، OpenVINO، SYCL، ROCm)، Android، و openEuler.

يتيح هذا التغيير للمستخدمين تشغيل النماذج ذات أبعاد الرأس غير القياسية على الأجهزة المدعومة دون مشاكل توافق.