Proyek llama.cpp telah meningkatkan batas baris-id yang di-angkat untuk operasi mul_mat_id Vulkan dari 256 ahli menjadi 1024 ahli. Perubahan ini mengatasi hambatan kinerja pada model dengan jumlah ahli besar, seperti Qwen3.8-Flash-Next, yang sebelumnya berjalan pada jalur kode yang lebih lambat karena keterbatasan ukuran array bersama.

Pembaruan ini mengubah shader count_experts.comp untuk menggunakan konstanta MAX_EXPERTS sebesar 1024, memperbesar array bersama menjadi 12 KiB sambil tetap berada dalam jaminan 16 KiB Vulkan. Pada perangkat keras Strix Halo dengan ukuran batch 2048, perkalian matriks ahli turun dari 12,5 menjadi 9,5 ms untuk iq3_s dan dari 14,0 menjadi 7,5 ms untuk iq4_nl per operasi. Kecepatan pemrosesan prompt meningkat sekitar 19% pada 8k token, dan pengujian backend MUL_MAT_ID berhasil dengan kasus ahli 1024 baru.

Optimasi ini memungkinkan llama.cpp menangani model yang melebihi ambang batas ahli 512 sebelumnya secara efisien tanpa penurunan kinerja pada perangkat keras yang kompatibel dengan Vulkan.