Proyek llama.cpp merilis versi b10718, yang mencakup pembaruan signifikan pada backend CUDA-nya. Perubahan paling notable adalah perluasan fusi Mixture of Experts (MOE) untuk mendukung decoding spekulatif (specdec), mengatasi keterbatasan sebelumnya di mana fusi MOE glu dan topk-router dibatasi hanya memproses satu token pada satu waktu.

  • CUDA: Fusi MOE diperluas ke specdec, menghapus pembatasan single-token untuk fusi MOE glu dan topk-router sebelumnya.
  • Menambahkan dukungan kasus SWIGLU_CLAMP ke implementasi fusi MOE multi-token.
  • Menangani komentar review dari pull request #27621.

Pembaruan ini meningkatkan kinerja model yang menggunakan decoding spekulatif dengan mengaktifkan operasi fusi yang lebih efisien pada GPU NVIDIA.