أصدر مشروع llama.cpp الإصدار b10988، مقدمًا تغييرات على الخلفية البرمجية لـ OpenCL خصيصًا لنماذج Mixture of Experts (MoE). تنفذ التحديث منطقًا لاختيار ضرب مصفوفة خبراء MoE بناءً على حجم الدفعة أثناء الترميز التوقعي والتنبؤ متعدد الرموز.

  • تقييد عملية GEMM q4_0 MoB المبنية مسبقًا حسب عدد التوجيهات.
  • التوقف عن كتابة الأصفار في فتحات تنشيط Moء المبطنة لتحسين الكفاءة.
  • توفير ملفات قابلة للتنفيذ لأنظمة macOS و Linux و Windows و Android و openEuler عبر منصات CPU و CUDA و ROCm و Vulkan و OpenVINO و SYCL و Adreno.