O projeto llama.cpp adicionou ajustes de vetor de atenção rápida (fa-vec) para a GPU Apple M4 Pro por meio de uma nova contribuição ao backend Metal. Esta atualização segue o trabalho anterior para suportar GPUs adicionais da Apple e foi gerada usando a ferramenta `ggml-metal-tuning` em um MacBook Pro de 14 polegadas de novembro de 2024.

  • O processo de ajuste foi executado com sucesso em 1 hora, 13 minutos e 1 segundo sem outra carga no sistema.
  • A contribuição suporta os tipos de dados f16 e q8_0 para a arquitetura M4 Pro.
  • Esta versão inclui binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenCL, ROCm, OpenVINO, SYCL) e openEuler.