Проект llama.cpp выпустил версию b10615, вводя настройку под каждое устройство квантованных (Q, NE) векторных операций flash-attention для бэкенда Metal.

  • Добавлено 53 инстанциации векторов flash-attn f16, увеличив общее количество с 80 до 133.
  • Реализована таблица настройки и маршрутизация с резервированием общей памяти.
  • Расширена настройка векторов для поддержки квантованных KV кэшей.
  • Включены настроенные параметры для устройств M1 Pro, M2 Ultra и M5 Max.

Это обновление оптимизирует производительность на оборудовании Apple Silicon, применяя специфические результаты настройки к бэкенду Metal.