أصدر مشروع llama.cpp الإصدار b10718، والذي يتضمن تحديثًا مهمًا لخلفية CUDA. أبرز تغيير هو توسيع دمج Mixture of Experts (MOE) لدعم الترميز التخميني (specdec)، مما يعالج القيود السابقة حيث كان دمج MOE glu و topk-router مقيدًا بمعالجة رمز واحد فقط في كل مرة.

  • CUDA: تم توسيع دمج MOE ليشمل specdec، وإزالة قيد الرمز الواحد لدمج MOE glu و topk-router السابق.
  • تمت إضافة دعم حالة SWIGLU_CLAMP إلى تنفيذ دمج MOE متعدد الرموز.
  • تم معالجة تعليقات المراجعة من طلب السحب #27621.

يحسن هذا التحديث أداء النماذج التي تستخدم الترميز التخميني من خلال تمكين عمليات مدمجة أكثر كفاءة على وحدات GPU من NVIDIA.