llama.cpp 项目发布了版本 b10816,其中包括针对 Apple Silicon 设备的 Metal 后端的更新。此次发布专注于为 M3 芯片架构添加剩余的 fast-vector 调优。
- 在 fa_vec_tuned_table 中添加 M3 条目。
- 在 ggml-metal-tuning 中包含 q4_0、q4_1、q5_0 和 q5_1 量化。
- 提供适用于 macOS(Apple Silicon 和 Intel)、iOS、Linux、Windows、Android 和 openEuler 的二进制文件。
- 支持多种后端,包括 CPU、Vulkan、ROCm 10.0、OpenVINO、SYCL、CUDA 12/13 和 OpenCL Adreno。
此更新确保了针对 M3 硬件的优化性能,同时扩大了预编译二进制文件在多个操作系统和 GPU 架构上的可用性。