llama.cpp b10751 funde a redução de especialistas ponderados do MoE para CUDA
O projeto llama.cpp lançou a compilação b10751, que introduz um kernel fundido para a redução de especialistas ponderados do MoE (Mixture of Experts) no CUDA. Essa otimização substitui a linha de base anterior, que executava dois kernels físicos, por um único kernel de redução ponderada para reduzir o tráfego de memória global intermediário.