O projeto llama.cpp lançou a versão b10739, que inclui uma otimização de desempenho específica para o hardware Apple M2 Max. Esta atualização introduz o ajuste de vetores de atenção rápida (fa-vec) adaptado aos 30 núcleos GPU do M2 Max.

  • Adicionadas linhas de ajuste fa-vec para M2 Max coletadas com ggml-metal-tuning em dtypes f16 e q8_0.
  • Fornecidos binários para macOS Apple Silicon, Macs Intel, iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.

Este lançamento garante um desempenho de inferência otimizado no mais recente Apple silicon enquanto mantém amplo suporte em vários sistemas operacionais e aceleradores de hardware.