Rilis llama.cpp b10255 memperluas jalur SDPA oneDNN untuk mendukung cache kunci-nilai (KV) non-FP16, termasuk format kuantisasi Q4_0–Q8_0 dan FP32. Pembaruan ini memungkinkan kernel sistolik terpadu berjalan secara identik dengan jalur FP16 asli dengan melakukan dekuantisasi atau mengonversi tensor K/V ke FP16 padat di perangkat sebelum diproses.

  • Jenis KV yang didukung mencakup Q4_0, Q4_1, Q5_0, Q5_1, Q8_0, dan F32, sementara jenis BF16 dan IQ dikecualikan karena kurangnya kernel konversi.
  • Dukungan non-FP16 dibatasi oleh persyaratan bahwa K >= 1024 dan Q >= 32 selama fase prefill.
  • Rilis ini mencakup perbaikan sinkronisasi aliran yang memastikan perilaku wait_and_throw tanpa syarat dan menghapus aliasing V_is_K_view untuk memastikan K dan V selalu didekuantisasi ke buffer terpisah.
  • Biner disediakan untuk macOS, Linux, Windows, Android, dan openEuler di seluruh CPU, GPU (CUDA, Vulkan, ROCm, OpenCL), dan backend khusus seperti SYCL dan OpenVINO.