تُقدم إصدار llama.cpp b11095 تنفيذًا جديدًا لـ GATED_DELTA_NET (GDN) محسّنًا لـ HMX، جنبًا إلى جنب مع تحسينات مختلفة لأنوية Hexagon و Flash Attention.
- يتضمن دعم GDN التسلسل، وتوجيه HVX، والعمليات المتجهة لتحسين الأداء على شرائح Qualcomm.
- تقلل تحديثات Flash Attention من قراءات DDR بنسبة 20-30٪ أثناء توليد الرموز من خلال التراكم في السجلات وتحسينات تسلسل DMA.
- يوفر الإصدار ملفات ثنائية لنظامي macOS و Linux و Windows و Android و openEuler عبر خلفيات CPU و CUDA و ROCm و Vulkan و OpenVINO.
يعزز هذا التحديث كفاءة الاستدلال على بنية الأجهزة المحددة مع الحفاظ على توافق واسع مع بيئات النشر الحالية.