Proyek llama.cpp merilis versi b11206, yang memperkenalkan dukungan untuk sampler backend Hexagon. Pembaruan ini mencakup beberapa perubahan pada pipeline sampling dan operasi pada NPU Hexagon.

  • Menambahkan operasi STEP dan SUM ke hex-sampler.
  • Memperbarui CPY untuk mendukung kasus sampling.
  • Menambahkan dukungan chunking di hex-binary untuk menangani logits besar.
  • Mengimplementasikan versi dasar ARGMAX untuk hex-argmax.
  • Memperbaiki masalah pengindeksan untuk broadcast dim 1 melintasi slice dim 2.
  • Menonaktifkan autovectorizer untuk menggunakan petunjuk eksplisit pada loop kritis.

Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler di berbagai backend perangkat keras termasuk CPU, GPU, dan NPU.