llama.cpp 项目发布了版本 b10336,其中包括对多个 wgsl 文件的重构以及 ggml-webgpu 组件内 flash_attn wgsl 的简化。

此更新提供了适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(Ubuntu CPU、Vulkan、ROCm 7.2、OpenVINO、SYCL)、Android、Windows(CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL、HIP)和 openEuler 平台的二进制文件。

该版本还包含标准的 UI 构建,供用户与模型推理引擎进行交互。