Le projet llama.cpp a ajouté des réglages de vecteur d'attention rapide (fa-vec) pour le GPU Apple M4 Pro via une nouvelle contribution au backend Metal. Cette mise à jour fait suite aux travaux précédents pour supporter les GPU Apple supplémentaires et a été générée en utilisant l'outil `ggml-metal-tuning` sur un MacBook Pro de 14 pouces de novembre 2024.

  • Le processus de réglage s'est exécuté avec succès en 1 heure, 13 minutes et 1 seconde sans autre charge système.
  • La contribution prend en charge les types de données f16 et q8_0 pour l'architecture M4 Pro.
  • Cette version inclut des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenCL, ROCm, OpenVINO, SYCL) et openEuler.