Proyek llama.cpp merilis versi b11070, yang menampilkan perombakan signifikan pada backend Hexagon untuk mendukung pemetaan memori 64-bit dan penanganan buffer yang lebih luas. Pembaruan ini mengaktifkan dukungan DMA (Direct Memory Access) yang tepat untuk model yang lebih besar dan operasi kompleks pada DSP Qualcomm Hexagon.

  • Mengaktifkan pemetaan buffer yang diperluas dan DMA 64-bit melalui modul `hex-dma64`.
  • Memperluas operasi biner untuk mendukung lebih banyak skenario DMA dan memperbarui SSM_CONV agar menggunakan DMA dengan dukungan 64-bit.
  • Meningkatkan jumlah pemetaan memori (mmaps) menjadi 64 untuk mencegah penghapusan pada model yang lebih besar.
  • Menulis ulang loop softmax dan GDN untuk memanfaatkan DMA, meningkatkan penggunaan register HVX.
  • Menambahkan ring sekunder sebagai cadangan untuk transaksi DMA yang terlalu besar.

Rilis ini mencakup biner untuk macOS, Linux, Windows, Android, dan openEuler di seluruh backend CPU, GPU (CUDA, Vulkan, ROCm), dan NPU.