Proyek llama.cpp telah merilis versi b10213, memperkenalkan dukungan untuk kuantisasi cache kunci-nilai yang diputar. Pembaruan ini tersedia di berbagai platform dan akselerator perangkat keras.

  • macOS Apple Silicon (arm64) dan Intel (x64)
  • iOS melalui XCFramework
  • Linux Ubuntu x64 dan arm64 (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL FP32/FP16)
  • Windows x64 dan arm64 (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP)
  • Android arm64 (CPU)
  • openEuler x86 dan aarch64 (ACL Graph)

Rilis ini mencakup biner untuk aplikasi utama serta paket UI terpisah.