Проект llama.cpp выпустил версию b10615, вводя настройку под каждое устройство квантованных (Q, NE) векторных операций flash-attention для бэкенда Metal.
- Добавлено 53 инстанциации векторов flash-attn f16, увеличив общее количество с 80 до 133.
- Реализована таблица настройки и маршрутизация с резервированием общей памяти.
- Расширена настройка векторов для поддержки квантованных KV кэшей.
- Включены настроенные параметры для устройств M1 Pro, M2 Ultra и M5 Max.
Это обновление оптимизирует производительность на оборудовании Apple Silicon, применяя специфические результаты настройки к бэкенду Metal.