Proyek llama.cpp merilis build b10758, memperkenalkan kemampuan fusi MUL_MAT dan MUL_MAT_ID untuk DSP Hexagon. Pembaruan ini juga mencakup beberapa perbaikan untuk meningkatkan stabilitas dan kinerja pada perangkat keras Qualcomm.
- Menggabungkan matmul QKV dan FFN yang masuk ke HMX.
- Menghapus batasan ne[1] < 32K yang dikodekan secara tetap.
- Memperbaiki ukuran overhead untuk mencegah melebihi anggaran vtcm untuk dimensi besar.
- Menggabungkan MUL_MAT_ID ke varian MUL_MAT_ID_NX jika memungkinkan.
- Memperbarui ukuran opbatch dan opqueue untuk mengurangi overhead alokasi buffer jejak.
- Menambahkan defragmentasi ruang alamat virtual untuk menghindari abort karena fragmentasi.
Perubahan ini mengoptimalkan penggunaan memori dan efisiensi eksekusi untuk perangkat berbasis Hexagon.