Le projet llama.cpp a publié la version b10164, introduisant une nouvelle implémentation de multiplication matricielle SSD fractionnée conçue pour accélérer la phase de préremplissage des modèles Mamba-2.

  • ggml-cuda : ajout de la multiplication matricielle SSD fractionnée pour accélérer le préremplissage de Mamba-2
  • Corrections de correction de CUDA SSD en promouvant s0_stride_seq à int64_t et en améliorant le regroupement mémoire dans ssm_ssd_prepare_dt_kernel
  • Matérialisation fusionnée de la matrice M dans le noyau pre_matmul
  • Correction de la course de lecture-écriture sdata dans la boucle de balayage de repli de prepare_dt
  • Ajout des corrections CICD SSD pour CUDA, HIP, MUSA et MSVC

Cette mise à jour fournit des noyaux GPU optimisés pour des architectures spécifiques de modèles d'espace d'état tout en maintenant une large compatibilité avec les backends CPU, Vulkan, ROCm, OpenVINO et SYCL.