Проект llama.cpp выпустил версию b10164, представляющую новую реализацию чанкового умножения матриц SSD, предназначенную для ускорения фазы префилла моделей Mamba-2.

  • ggml-cuda: добавлено чанковое SSD-умножение матриц для ускорения префилла Mamba-2
  • Исправления корректности CUDA SSD путем повышения s0_stride_seq до int64_t и улучшение совмещения памяти в ssm_ssd_prepare_dt_kernel
  • Слиянная материализация матрицы M в ядре pre_matmul
  • Исправлена гонка чтения-записи sdata в цикле сканирования резервного варианта prepare_dt
  • Добавлены исправления SSD CICD для CUDA, HIP, MUSA и MSVC

Это обновление предоставляет оптимизированные GPU-ядра для конкретных архитектур моделей пространства состояний, сохраняя при этом широкую совместимость с бэкендами CPU, Vulkan, ROCm, OpenVINO и SYCL.