Проект llama.cpp выпустил версию b10164, представляющую новую реализацию чанкового умножения матриц SSD, предназначенную для ускорения фазы префилла моделей Mamba-2.
- ggml-cuda: добавлено чанковое SSD-умножение матриц для ускорения префилла Mamba-2
- Исправления корректности CUDA SSD путем повышения s0_stride_seq до int64_t и улучшение совмещения памяти в ssm_ssd_prepare_dt_kernel
- Слиянная материализация матрицы M в ядре pre_matmul
- Исправлена гонка чтения-записи sdata в цикле сканирования резервного варианта prepare_dt
- Добавлены исправления SSD CICD для CUDA, HIP, MUSA и MSVC
Это обновление предоставляет оптимизированные GPU-ядра для конкретных архитектур моделей пространства состояний, сохраняя при этом широкую совместимость с бэкендами CPU, Vulkan, ROCm, OpenVINO и SYCL.