دمج llama.cpp b10751 لتقليل خبراء MoE المرجحين لـ CUDA
أصدر مشروع llama.cpp الإصدار b10751، الذي يقدم نواة مدمجة لتقليل الخبراء المرجحين في نموذج MoE (خلطة الخبراء) على CUDA. يحل هذا التحسين محل الأساس السابق الذي كان يشغل نواتين فيزيائيتين بنواة واحدة لتقليل المرجح، مما يقلل من حركة بيانات الذاكرة العالمية الوسيطة.