Proyek llama.cpp merilis build b10730, yang mencakup optimasi untuk arsitektur model Qwen4exp. Perubahan utama melibatkan penjumlahan kepala indexer berdasarkan irisan alih-alih menggunakan operasi transpose dan sum_rows, sehingga mengurangi overhead salinan memori.
- Kecepatan pemrosesan prompt meningkat dari 2170 menjadi 2366 token per detik pada RTX PRO 6000 dengan Qwen3.8-Flash-Next UD-Q4_K_XL.
- Optimasi ini menghapus persyaratan tensor kontigu redundan untuk kueri indexer, karena rope mengembalikan tensor kontigu yang baru dialokasikan.
- Kecepatan generasi tidak terpengaruh, tetapi peningkatan dalam pemrosesan prompt berskala dengan panjang konteks dan ukuran ubatch.
- Output greedy tetap tidak berubah token demi token dibandingkan versi sebelumnya.
Pembaruan ini meningkatkan efisiensi untuk tugas inferensi konteks panjang yang melibatkan model Qwen4exp dengan mengurangi pemborosan komputasi selama fase pemrosesan prompt.