llama.cpp b10751 menggabungkan reduksi ahli berbobot MoE untuk CUDA
Proyek llama.cpp merilis build b10751, yang memperkenalkan kernel terintegrasi untuk reduksi ahli berbobot MoE (Mixture of Experts) pada CUDA. Optimisasi ini mengganti baseline sebelumnya yang menjalankan dua kernel fisik dengan satu kernel reduksi berbobot untuk mengurangi lalu lintas memori global antar perantara.