El proyecto llama.cpp ha añadido registros de ajuste de vector de atención rápida (fa-vec) para las GPU Apple M3 Max, M5 y M5 Pro con el fin de mejorar el rendimiento de Metal.
- Los ajustes para la Apple M5 se generaron en una máquina M5 utilizando tipos de datos f16 y q8_0.
- Los registros para la Apple M5 Pro cubren los formatos F16, Q4_0 y Q8_0 a través de 20 núcleos de GPU.
- El soporte para el M3 Max incluye configuraciones F16 y Q8_0 en un MacBook Pro con 64GB en modo de bajo consumo.
Estas actualizaciones amplían las capacidades de aceleración de Metal a nuevas arquitecturas de Apple silicon.