أصدر مشروع llama.cpp الإصدار b10751، الذي يقدم نواة مدمجة لتقليل الخبراء المرجحين في نموذج MoE (خلطة الخبراء) على CUDA. يحل هذا التحسين محل الأساس السابق الذي كان يشغل نواتين فيزيائيتين بنواة واحدة لتقليل المرجح، مما يقلل من حركة بيانات الذاكرة العالمية الوسيطة.

  • تتعامل النواة المدمجة مع k=2..15 خبراء عبر نواة runtime-k واحدة، وتدعم كلًا من رسوم بيانية لوزن الخبراء غير المضبوطة والمضبوطة.
  • تطابق تسلسلات العمليات الهيكلية، والأشكال، والخطوات، وسلاسل الجمع من اليسار إلى اليمين مع الحفاظ على نفس ترتيب التقليل.
  • يضمن تكامل المخصص بقاء الخبراء وأوزان الموجه والمقاييس الاختيارية نشطة حتى يتم الكتابة إلى الوجهة المدمجة.
  • تسقط الرسوم البيانية غير المعروفة أو غير الآمنة إلى المسار القائم لكل عملية، والذي يمكن تعطيله عبر GGML_CUDA_MOE_WEIGHTED_REDUCTION=0.

يحسن هذا التغيير الأداء لنماذج MoE على CUDA عن طريق تقليل استخدام عرض النطاق الترددي للذاكرة أثناء مرحلة دمج الخبراء.