Proyek llama.cpp merilis build b10751, yang memperkenalkan kernel terintegrasi untuk reduksi ahli berbobot MoE (Mixture of Experts) pada CUDA. Optimisasi ini mengganti baseline sebelumnya yang menjalankan dua kernel fisik dengan satu kernel reduksi berbobot untuk mengurangi lalu lintas memori global antar perantara.

  • Kernel terintegrasi menangani k=2..15 ahli melalui satu kernel runtime-k, mendukung grafik bobot ahli yang tidak diskalakan dan yang diskalakan.
  • Ia mencocokkan urutan operasi struktural, bentuk, langkah, dan rantai ADD kiri-ke-kanan sambil mempertahankan urutan reduksi yang sama.
  • Integrasi alokator memastikan ahli, bobot router, dan skala opsional tetap aktif hingga tujuan terintegrasi ditulis.
  • Grafik yang tidak dikenali atau tidak aman akan kembali ke jalur per-op yang ada, yang dapat dinonaktifkan melalui GGML_CUDA_MOE_WEIGHTED_REDUCTION=0.

Perubahan ini meningkatkan kinerja untuk model MoE pada CUDA dengan meminimalkan penggunaan bandwidth memori selama fase kombinasi ahli.