llama.cpp 项目发布了构建版本 b10756,该版本修改了 Vulkan 后端的行为,仅在硬件支持时才请求 VK_KHR_shader_bfloat16 扩展。

此更新解决了因请求不受支持的扩展而在某些 GPU 上导致失败的问题。本次发布包含了适用于 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows(CPU、CUDA 12/13、Vulkan、OpenCL、ROCm、SYCL)、Android 和 iOS 的二进制文件。

该更改确保在不支持 bfloat16 shader 扩展的设备上,基于 Vulkan 的推理能正确运行。