llama.cpp 项目发布了构建版本 b11382,其中包含对其 WebGPU 后端的重大更新。此版本专门为 WebGPU 实现中的 `fill` 和 `set_rows` 操作添加了 16 位浮点数 (f16) 支持。

  • 源代码更改在 ggml-org/llama.cpp 仓库的 pull request #29897 中跟踪。
  • 提供适用于 macOS (Apple Silicon 和 Intel)、iOS、Linux (CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL、Snapdragon)、Windows (CPU、OpenCL、CUDA、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler 的二进制文件。
  • 该版本还包含标准的 llama.cpp UI 二进制文件。