llama.cpp 프로젝트는 Mamba-2 모델의 프리필 단계를 가속화하도록 설계된 새로운 청크화된 SSD 행렬 곱 구현을 도입한 버전 b10164을 출시했습니다.

  • ggml-cuda: Mamba-2 프리필 가속을 위해 청크화된 SSD 행렬 곱 추가
  • s0_stride_seq를 int64_t로 승격하고 ssm_ssd_prepare_dt_kernel에서 메모리 결합을 개선하여 CUDA SSD 정확성 수정
  • pre_matmul 커널로의 M 행렬 머터리얼라이제이션 융합
  • prepare_dt 폴백 스캔 루프의 sdata 읽기-쓰기 경합 수정
  • CUDA, HIP, MUSA 및 MSVC용 SSD CICD 수정 추가

이 업데이트는 CPU, Vulkan, ROCm, OpenVINO 및 SYCL 백엔드 전반에 걸친 광범위한 호환성을 유지하면서 특정 상태 공간 모델 아키텍처를 위한 최적화된 GPU 커널을 제공합니다.