أصدر مشروع llama.cpp الإصدار b10615، مقدمًا عمليات متجهية flash-attention مُكمَّمة (Q, NE) ومضبوطة لكل جهاز لخلفية Metal.

  • تمت إضافة 53 مثيلًا للمتجهات flash-attn f16، مما زاد العدد الإجمالي من 80 إلى 133.
  • تم تنفيذ جدول ضبط وتوصيل الإرسال مع التراجع عن سعة الذاكرة المشتركة.
  • تم توسيع ضبط المتجهات لدعم مخازن KV المُكمَّمة.
  • تم تضمين معاملات مضبوطة لأجهزة M1 Pro و M2 Ultra و M5 Max.

تحسّن هذه التحديث الأداء على عتاد Apple Silicon من خلال تطبيق نتائج الضبط المحددة على خلفية Metal.