Proyek llama.cpp merilis versi b10164, memperkenalkan implementasi perkalian matriks SSD terfragmentasi baru yang dirancang untuk mempercepat fase prefill model Mamba-2.

  • ggml-cuda: tambahkan matmul SSD terfragmentasi untuk akselerasi prefill Mamba-2
  • Perbaikan koreksi CUDA SSD dengan mempromosikan s0_stride_seq ke int64_t dan meningkatkan penggabungan memori di ssm_ssd_prepare_dt_kernel
  • Materialisasi matriks M yang dilebur ke dalam kernel pre_matmul
  • Memperbaiki race baca-tulis sdata di loop pemindaian fallback prepare_dt
  • Menambahkan perbaikan CICD SSD untuk CUDA, HIP, MUSA, dan MSVC

Pembaruan ini menyediakan kernel GPU yang dioptimalkan untuk arsitektur model ruang keadaan tertentu sambil mempertahankan kompatibilitas luas dengan backend CPU, Vulkan, ROCm, OpenVINO, dan SYCL.