llama.cpp 项目通过新的 Metal 后端贡献,为 Apple M4 Pro GPU 添加了快速注意力向量 (fa-vec) 调优。此更新紧随支持其他 Apple GPU 的先前工作,并使用 `ggml-metal-tuning` 工具在 2024 年 11 月的 14 英寸 MacBook Pro 上生成。
- 调优过程在无其他系统负载的情况下成功运行了 1 小时 13 分钟 1 秒。
- 该贡献支持 M4 Pro 架构的 f16 和 q8_0 数据类型。
- 此版本包括 macOS (Apple Silicon 和 Intel)、iOS、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA、Vulkan、OpenCL、ROCm、OpenVINO、SYCL) 和 openEuler 的二进制文件。