llama.cpp 项目发布了版本 b10539,解决了 Vulkan 后端中的一个关键数值稳定性问题,同时扩展了 Windows 用户的硬件支持。

  • Vulkan FA MMQ 现在使用 fp32 进行 Q 量化计算,以防止当 qd 为次正规数时发生溢出。
  • 添加了适用于 CUDA 13 的 Windows x64 二进制文件,以及对带有 CUDA 13.4 的 Windows arm64 的预览支持。
  • 包含了 Ubuntu s390x (CPU)、macOS Intel (x64) 和 iOS XCFramework 的构建版本。
  • OpenCL Adreno 支持现已适用于 Windows arm64。

此更新通过防止算术错误确保 Vulkan 设备的可靠性能,并为用户提供最新的 CUDA 13 兼容性选项。