Проект llama.cpp выпустил версию b10632, которая вводит оптимизацию чанкового SSD MMA для префилла Mamba-2 через ggml-metal.
- Добавлены WIP чанковые ядра SSD SSM_SCAN для многозадачного префилла на Metal.
- Отказ от скалярного пути SSD в пользу MMA, объединенного с последовательным хвостом.
- Резервирует K токенов для снимков отката последовательного ядра и сбрасывает параллелизм между MMA и seq tail.
- Специализирует хвост ssm_scan с помощью шаблона и обновляет константы для ясности.
Это обновление предоставляет бинарные файлы для macOS, iOS, Linux, Windows, Android и openEuler на различных аппаратных бэкендах, включая CPU, CUDA, ROCm, Vulkan и OpenVINO.