llama.cpp b10751 fusiona la reducción de expertos ponderados de MoE para CUDA
El proyecto llama.cpp lanzó la versión b10751, que introduce un núcleo fusionado para la reducción de expertos ponderados de MoE (Mixture of Experts) en CUDA. Esta optimización reemplaza la línea base anterior que ejecutaba dos núcleos físicos con un único núcleo de reducción ponderada para reducir el tráfico intermedio de memoria global.