llama.cpp b10255 版本将 oneDNN SDPA 路径扩展为支持非 FP16 键值 (KV) 缓存,包括 Q4_0–Q8_0 量化格式和 FP32。此更新允许融合脉动核在设备上将 K/V 张量反量化或转换为密集 FP16 后,以与原生 FP16 路径相同的方式运行。
- 支持的 KV 类型包括 Q4_0、Q4_1、Q5_0、Q5_1、Q8_0 和 F32,而 BF16 和 IQ 类型因缺少转换核而被排除。
- 非 FP16 支持受预填充阶段中 K >= 1024 且 Q >= 32 的要求限制。
- 该版本包含一个流同步修复,确保无条件执行 wait_and_throw 行为,并移除 V_is_K_view 别名,以确保 K 和 V 始终反量化到独立的缓冲区。
- 提供适用于 macOS、Linux、Windows、Android 和 openEuler 的二进制文件,覆盖 CPU、GPU(CUDA、Vulkan、ROCm、OpenCL)以及 SYCL 和 OpenVINO 等专用后端。