Le projet llama.cpp a ajouté des enregistrements de réglage de vecteur d'attention rapide (fa-vec) pour les GPU Apple M3 Max, M5 et M5 Pro afin d'améliorer les performances de Metal.

  • Les réglages pour l'Apple M5 ont été générés sur une machine M5 en utilisant les types de données f16 et q8_0.
  • Les enregistrements pour l'Apple M5 Pro couvrent les formats F16, Q4_0 et Q8_0 sur 20 cœurs GPU.
  • La prise en charge du M3 Max inclut les configurations F16 et Q8_0 sur un MacBook Pro avec 64 Go en mode basse consommation.

Ces mises à jour étendent les capacités d'accélération de Metal aux nouvelles architectures Apple silicon.