llama.cpp 项目发布了构建版本 b10656,其中包括对工作内存大小的限制更改。此修改旨在防止大型张量被加载到系统 RAM 中。

  • 该版本提供了适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux(Ubuntu x64、arm64、s390x)、Android、Windows 和 openEuler 的二进制文件。
  • 支持的后端包括 CPU、Vulkan、ROCm 7.14、OpenVINO、SYCL、CUDA 12/13 和 OpenCL Adreno。
  • 此构建中禁用了 macOS Apple Silicon 的 KleidiAI 支持。

通过限制工作内存占用,此更新确保了量化过程中更稳定的内存使用。