Proyek llama.cpp merilis versi b10643, memperkenalkan dukungan untuk perangkat multi-NPU (IQ9, IQ10) dan backend sepenuhnya asinkron untuk arsitektur Hexagon.
- Backend Hexagon sekarang menggunakan buffer non-host secara default dan mengimplementasikan asinkronisitas penuh.
- Dukungan untuk platform Snapdragon Android 34 ditambahkan.
- Kuantisasi Q8_0 mendapatkan dukungan untuk dequantizer in-place, pipeline DMA, dan operasi baris.
- Operasi ALLREDUCE dioptimalkan dengan kernel yang digabungkan dan efisiensi DMA yang ditingkatkan.
- Token sinkronisasi dan mekanisme fence ditingkatkan untuk menyinkronkan perangkat NPU di antara split asinkron.
Perubahan ini memungkinkan inferensi efisien pada hardware Snapdragon multi-NPU dengan memungkinkan eksekusi perangkat konkuren dan salinan tensor yang lebih cepat.