llama.cpp 项目已为 Apple M3 Max、M5 和 M5 Pro GPU 添加了快速注意力向量 (fa-vec) 调优记录,以改进 Metal 性能。
- Apple M5 的调优是在使用 f16 和 q8_0 数据类型的 M5 机器上生成的。
- Apple M5 Pro 的记录涵盖 20 个 GPU 核心上的 F16、Q4_0 和 Q8_0 格式。
- 对 M3 Max 的支持包括在配备 64GB 内存且处于低功耗模式的 MacBook Pro 上的 F16 和 Q8_0 配置。
这些更新将 Metal 加速功能扩展到了更新的 Apple silicon 架构。