llama.cpp プロジェクトはバージョン b10164 をリリースし、Mamba-2 モデルのプリフィルフェーズを加速するために設計された新しいチャンク化された SSD 行列乗算の実装を導入しました。
- ggml-cuda: Mamba-2 プリフィルの高速化のためにチャンク化された SSD 行列乗算を追加
- s0_stride_seq を int64_t に昇格させ、ssm_ssd_prepare_dt_kernel 内のメモリ結合を改善することで CUDA SSD の正確性を修正
- pre_matmul カーネルへの M 行列のマテリアライズの融合
- prepare_dt フォールバックスキャンループ内の sdata 読み書き競合を修正
- CUDA、HIP、MUSA、MSVC 用の SSD CICD 修正を追加
このアップデートは、CPU、Vulkan、ROCm、OpenVINO、SYCL バックエンドとの広範な互換性を維持しながら、特定の状態空間モデルアーキテクチャ向けの最適化された GPU カーネルを提供します。