llama.cpp b10751 fusionne la réduction pondérée des experts MoE pour CUDA
Le projet llama.cpp a publié la version b10751, qui introduit un noyau fusionné pour la réduction pondérée des experts MoE (Mixture of Experts) sur CUDA. Cette optimisation remplace le précédent point de référence qui exécutait deux noyaux physiques par un seul noyau de réduction pondérée afin de réduire les transferts intermédiaires vers la mémoire globale.