Rilis llama.cpp b11095 memperkenalkan implementasi GATED_DELTA_NET (GDN) baru yang dioptimalkan untuk HMX, bersama dengan berbagai optimisasi untuk kernel Hexagon dan Flash Attention.
- Dukungan GDN mencakup pipelineing, penyanggaan HVX, dan operasi vektor untuk meningkatkan kinerja pada chip Qualcomm.
- Pembaruan Flash Attention mengurangi bacaan DDR sebesar 20-30% selama generasi token melalui akumulasi dalam register dan peningkatan pipeline DMA.
- Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler di seluruh backend CPU, CUDA, ROCm, Vulkan, dan OpenVINO.
Pembaruan ini meningkatkan efisiensi inferensi pada arsitektur perangkat keras tertentu sambil mempertahankan kompatibilitas luas dengan lingkungan penyebaran yang ada.