O projeto llama.cpp adicionou registros de ajuste de vetor de atenção rápida (fa-vec) para as GPUs Apple M3 Max, M5 e M5 Pro para melhorar o desempenho do Metal.
- Os ajustes para a Apple M5 foram gerados em uma máquina M5 usando tipos de dados f16 e q8_0.
- Os registros para a Apple M5 Pro cobrem os formatos F16, Q4_0 e Q8_0 em 20 núcleos de GPU.
- O suporte para o M3 Max inclui configurações F16 e Q8_0 em um MacBook Pro com 64GB no modo de baixo consumo.
Essas atualizações estendem as capacidades de aceleração do Metal para novas arquiteturas de Apple silicon.