llama.cpp 项目发布了版本 b10739,其中包括针对 Apple M2 Max 硬件的特定性能优化。此更新引入了针对 M2 Max 的 30 个 GPU 核心的快速注意力向量 (fa-vec) 调优。

  • 添加了使用 ggml-metal-tuning 在 f16 和 q8_0 数据类型上收集的 M2 Max fa-vec 调优行。
  • 提供了适用于 macOS Apple Silicon、Intel Macs、iOS、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows(CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android 和 openEuler 的二进制文件。

该版本确保在最新的 Apple silicon 上实现优化的推理性能,同时在各种操作系统和硬件加速器上保持广泛的支持。