llama.cpp 项目发布了构建版本 b10921,其中包含通过将张量绑定对齐到类型块大小来修复 WebGPU 的更新。此更改确保分块量化视图在着色器中获得有效的元素偏移量,通过回溯绑定偏移量,直到与张量的距离为整数个块。
该版本为 macOS(Apple Silicon 和 Intel)、iOS、Linux(Ubuntu,支持 CPU、Vulkan、ROCm、OpenVINO 和 SYCL 后端)、Android、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL 和 ROCm)以及 openEuler 提供了二进制文件和框架。
此更新确保在 WebGPU 着色器中正确处理张量,同时保持对广泛硬件架构和后端实现的支持。