Проект llama.cpp выпустил версию b10632, которая вводит оптимизацию чанкового SSD MMA для префилла Mamba-2 через ggml-metal.

  • Добавлены WIP чанковые ядра SSD SSM_SCAN для многозадачного префилла на Metal.
  • Отказ от скалярного пути SSD в пользу MMA, объединенного с последовательным хвостом.
  • Резервирует K токенов для снимков отката последовательного ядра и сбрасывает параллелизм между MMA и seq tail.
  • Специализирует хвост ssm_scan с помощью шаблона и обновляет константы для ясности.

Это обновление предоставляет бинарные файлы для macOS, iOS, Linux, Windows, Android и openEuler на различных аппаратных бэкендах, включая CPU, CUDA, ROCm, Vulkan и OpenVINO.