Proyek llama.cpp merilis versi b10704, yang memperbarui backend CUDA untuk menggunakan jalur mm_ids_helper yang dioptimalkan untuk jumlah ahli yang digunakan (n_expert_used) berapa pun. Sebelumnya, jalur cepat ini dibatasi oleh aturan divisibilitas ukuran warp, memaksa sebagian besar hitungan untuk kembali ke implementasi generik yang lebih lambat.
- Optimisasi ini menggeneralisasi padding hingga pangkat dua berikutnya, memungkinkan kasus seperti n_expert_used = 10 memanfaatkan jalur cepat.
- Diukur pada Qwen3.8-Flash-Next dengan 512 ahli dan 10 digunakan pada konteks 55k di RTX PRO 6000, kecepatan pemrosesan prompt meningkat dari 2334 menjadi 2600 token per detik.
- Kinerja generasi token tetap tidak terpengaruh karena optimisasi menargetkan pemrosesan token batched.
Perubahan ini meningkatkan latensi inferensi untuk model yang menggunakan arsitektur Mixture of Experts dengan mengurangi overhead selama pemrosesan prompt.