Proyek llama.cpp merilis versi b10718, yang mencakup pembaruan signifikan pada backend CUDA-nya. Perubahan paling notable adalah perluasan fusi Mixture of Experts (MOE) untuk mendukung decoding spekulatif (specdec), mengatasi keterbatasan sebelumnya di mana fusi MOE glu dan topk-router dibatasi hanya memproses satu token pada satu waktu.
- CUDA: Fusi MOE diperluas ke specdec, menghapus pembatasan single-token untuk fusi MOE glu dan topk-router sebelumnya.
- Menambahkan dukungan kasus SWIGLU_CLAMP ke implementasi fusi MOE multi-token.
- Menangani komentar review dari pull request #27621.
Pembaruan ini meningkatkan kinerja model yang menggunakan decoding spekulatif dengan mengaktifkan operasi fusi yang lebih efisien pada GPU NVIDIA.