أصدر مشروع llama.cpp الإصدار b10982، الذي يُدخل دعم الانتباه المتقطع السريع (sparse Flash Attention) عبر الخلفية (backend) الخاصة بـ Vulkan. يستهدف هذا التحديث بشكل خاص نماذج DSV4 وGLM، مما يتيح لها الاستفادة من آليات الانتباه المتوافق مع عتاد وحدات معالجة الرسومات المناسب.

  • يضيف دعم الانتباه المتقطع السريع لنماذج DSV4/GLM في تنفيذ Vulkan.
  • يتضمن منطق تنفيذ مُضبط واختبارات مُضافة.
  • يُصلح سلوك عملية الجمع الذري غير الحتمي (nondeterministic atomicAdd).
  • يضيف دعم متجه فك التشفير cm2 وربط f16vec4 لمتجهات فك التشفير.
  • يبسّط المنطق ويُحسّن اتساق تسمية المتغيرات.

يوفر هذا الإصدار ثنائيات مُعدة مسبقاً لأنظمة macOS وLinux وWindows وAndroid وopenEuler عبر خلفيات CPU وCUDA وROCm وOpenVINO وSYCL وVulkan.