Proyek llama.cpp merilis versi b11206, yang memperkenalkan dukungan untuk sampler backend Hexagon. Pembaruan ini mencakup beberapa perubahan pada pipeline sampling dan operasi pada NPU Hexagon.
- Menambahkan operasi STEP dan SUM ke hex-sampler.
- Memperbarui CPY untuk mendukung kasus sampling.
- Menambahkan dukungan chunking di hex-binary untuk menangani logits besar.
- Mengimplementasikan versi dasar ARGMAX untuk hex-argmax.
- Memperbaiki masalah pengindeksan untuk broadcast dim 1 melintasi slice dim 2.
- Menonaktifkan autovectorizer untuk menggunakan petunjuk eksplisit pada loop kritis.
Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler di berbagai backend perangkat keras termasuk CPU, GPU, dan NPU.