تُقدم إصدار llama.cpp b11095 تنفيذًا جديدًا لـ GATED_DELTA_NET (GDN) محسّنًا لـ HMX، جنبًا إلى جنب مع تحسينات مختلفة لأنوية Hexagon و Flash Attention.

  • يتضمن دعم GDN التسلسل، وتوجيه HVX، والعمليات المتجهة لتحسين الأداء على شرائح Qualcomm.
  • تقلل تحديثات Flash Attention من قراءات DDR بنسبة 20-30٪ أثناء توليد الرموز من خلال التراكم في السجلات وتحسينات تسلسل DMA.
  • يوفر الإصدار ملفات ثنائية لنظامي macOS و Linux و Windows و Android و openEuler عبر خلفيات CPU و CUDA و ROCm و Vulkan و OpenVINO.

يعزز هذا التحديث كفاءة الاستدلال على بنية الأجهزة المحددة مع الحفاظ على توافق واسع مع بيئات النشر الحالية.