Proyek llama.cpp merilis versi b10643, memperkenalkan dukungan untuk perangkat multi-NPU (IQ9, IQ10) dan backend sepenuhnya asinkron untuk arsitektur Hexagon.

  • Backend Hexagon sekarang menggunakan buffer non-host secara default dan mengimplementasikan asinkronisitas penuh.
  • Dukungan untuk platform Snapdragon Android 34 ditambahkan.
  • Kuantisasi Q8_0 mendapatkan dukungan untuk dequantizer in-place, pipeline DMA, dan operasi baris.
  • Operasi ALLREDUCE dioptimalkan dengan kernel yang digabungkan dan efisiensi DMA yang ditingkatkan.
  • Token sinkronisasi dan mekanisme fence ditingkatkan untuk menyinkronkan perangkat NPU di antara split asinkron.

Perubahan ini memungkinkan inferensi efisien pada hardware Snapdragon multi-NPU dengan memungkinkan eksekusi perangkat konkuren dan salinan tensor yang lebih cepat.