Proyek llama.cpp telah merilis versi b10538, memperkenalkan optimasi kunci pada backend metal. Pembaruan ini memungkinkan dekuantisasi cache kunci-nilai (KV) secara eksklusif untuk ukuran batch yang besar.

  • Perubahan utama ada pada backend metal, yang sekarang menerapkan caching KV yang didekuantisasi hanya saat memproses batch besar.
  • Binari tersedia untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.

Dukungan KleidiAI pada Apple Silicon untuk macOS dan ROCm 7.14 di Ubuntu dinonaktifkan dalam rilis ini.

Optimasi ini bertujuan untuk meningkatkan efisiensi memori atau kinerja untuk beban kerja yang melibatkan ukuran batch besar pada perangkat keras yang kompatibel.