تُطلق إصدار llama.cpp b10208 دعم SYCL لـ oneMKL GEMM flash attention، مما يتيح تسريع العتاد XMX لمعالجة الطلبات. يحسّن هذا التغيير سرعة الاستدلال بشكل كبير على بطاقات Intel Arc الرسومية باستخدام نوى MKL بدلاً من المسار الافتراضي TILE.

  • تُظهر مقاييس الأداء تسارعاً بمقدار 1.97x لـ Gemma-4-26B (1473 t/s مقابل 746 t/s) وتسارعاً بمقدار 1.85x لـ Qwen3.6-27B (609 t/s مقابل 330 t/s) على عتاد B70/Battlemage.
  • يُصلح التنفيذ أخطاء التخطيط المتداخل للوجهة في نوى التطبيع التي كانت تُفسد مخرجات الانتباه لمعظم النماذج سابقاً.
  • أصبح MKL flash attention مفعّلاً لجميع أنواع ذاكرة التخزين المؤقت KV (F16، BF16، F32، والمُكمَّاة)، مما يزيل القيود السابقة على الذاكرة المُكمَّاة فقط.
  • تتيح المتغيرات البيئية الجديدة للمستخدمين تفعيل التصحيح، أو تعطيل الميزة، أو التحكم في عتبات التفعيل عبر GGML_SYCL_ENABLE_MKL_FA.

يوفر هذا التحديث تخفيضات كبيرة في زمن الاستجابة لعمليات الحشو متعددة الرموز على العتاد المتوافق من Intel مع الحفاظ على توازي الارتباك (perplexity) مع التطبيقات القياسية.