أصدر مشروع llama.cpp الإصدار b11370، الذي يتضمن تحسينًا لـ CUDA لدمج الخبراء المشتركين في بنية Mixture of Moe مع التكميم المتجهي (MMVQ). يعد هذا التغيير جزءًا من طلب السحب #29184 ويتعامل أيضًا مع فحوصات الخانة الفارغة للمخازن المؤقتة ومعالجة الحجج لـ stride_col_dst.

  • يدمج الخبراء المشتركين في MMVQ لخلفيات CUDA.
  • يضيف فحوصات للخانة الفارغة للمخازن المؤقتة لتحسين الاستقرار.
  • ينقل stride_col_dst إلى حجج الدمج.

يوفر هذا الإصدار ملفات ثنائية محدثة لأنظمة macOS و Linux و Windows و Android و iOS عبر مسرعات الأجهزة المختلفة بما في ذلك CPU و Vulkan و ROCm و OpenVINO و SYCL و Snapdragon.