Proyek llama.cpp merilis build b10758, memperkenalkan kemampuan fusi MUL_MAT dan MUL_MAT_ID untuk DSP Hexagon. Pembaruan ini juga mencakup beberapa perbaikan untuk meningkatkan stabilitas dan kinerja pada perangkat keras Qualcomm.

  • Menggabungkan matmul QKV dan FFN yang masuk ke HMX.
  • Menghapus batasan ne[1] < 32K yang dikodekan secara tetap.
  • Memperbaiki ukuran overhead untuk mencegah melebihi anggaran vtcm untuk dimensi besar.
  • Menggabungkan MUL_MAT_ID ke varian MUL_MAT_ID_NX jika memungkinkan.
  • Memperbarui ukuran opbatch dan opqueue untuk mengurangi overhead alokasi buffer jejak.
  • Menambahkan defragmentasi ruang alamat virtual untuk menghindari abort karena fragmentasi.

Perubahan ini mengoptimalkan penggunaan memori dan efisiensi eksekusi untuk perangkat berbasis Hexagon.