Проект llama.cpp добавил записи настроек быстрого вектора внимания (fa-vec) для графических процессоров Apple M3 Max, M5 и M5 Pro с целью повышения производительности Metal.
- Настройки для Apple M5 были сгенерированы на машине M5 с использованием типов данных f16 и q8_0.
- Записи для Apple M5 Pro охватывают форматы F16, Q4_0 и Q8_0 на 20 ядрах GPU.
- Поддержка M3 Max включает конфигурации F16 и Q8_0 на MacBook Pro с 64 ГБ в режиме низкого энергопотребления.
Эти обновления расширяют возможности ускорения Metal для новых архитектур Apple silicon.