llama.cpp 项目发布了构建版本 b10673,其中包含针对 Apple M4 硬件的特定性能优化。此更新在 ggml-metal-tuning 模块中引入了 fa_vec_tuned_table 记录,以提升 Metal 后端的效率。
- 为拥有 10 个 GPU 核心的 M4 芯片上的 F16、Q4_0、Q4_1、Q5_0、Q5_1 和 Q8_0 量化添加了调优查找表。
- 提供 macOS Apple Silicon (arm64)、macOS Intel (x64) 和 iOS XCFramework 的二进制文件。
- 包含适用于 Ubuntu x64 和 arm64 的 Linux 构建,涵盖 CPU、Vulkan、ROCm 7.14、OpenVINO 和 SYCL 后端。
- 提供适用于 CPU、OpenCL Adreno、CUDA 12/13、Vulkan、OpenVINO、SYCL 和 ROCm 7.14 的 Windows 二进制文件。
- 添加 Android arm64 (CPU) 支持和 UI 二进制文件。
此发布版本确保 Apple M4 设备上的用户能够利用优化的 Metal 内核以实现更快的推理。