llama.cpp 项目发布了构建版本 b11333,在其 WebGPU 后端中引入了对 MUL_MAT、MUL_MAT_ID 和 GET_ROWS 操作的 bfloat16 支持。

此更新包含在 macOS(Apple Silicon 和 Intel)、iOS、Linux(Ubuntu x64、arm64、s390x)、Windows、Android 和 openEuler 的预编译二进制文件中。该版本为各种硬件加速器提供了构建,包括 CUDA 12 和 13、Vulkan、ROCm 10.0、OpenVINO、SYCL 和 Snapdragon NPUs。

在这些特定的 WebGPU 矩阵操作中添加 bfloat16 精度允许在兼容的 GPU 上进行更高效的计算。