llama.cpp プロジェクトはバージョン b10164 をリリースし、Mamba-2 モデルのプリフィルフェーズを加速するために設計された新しいチャンク化された SSD 行列乗算の実装を導入しました。

  • ggml-cuda: Mamba-2 プリフィルの高速化のためにチャンク化された SSD 行列乗算を追加
  • s0_stride_seq を int64_t に昇格させ、ssm_ssd_prepare_dt_kernel 内のメモリ結合を改善することで CUDA SSD の正確性を修正
  • pre_matmul カーネルへの M 行列のマテリアライズの融合
  • prepare_dt フォールバックスキャンループ内の sdata 読み書き競合を修正
  • CUDA、HIP、MUSA、MSVC 用の SSD CICD 修正を追加

このアップデートは、CPU、Vulkan、ROCm、OpenVINO、SYCL バックエンドとの広範な互換性を維持しながら、特定の状態空間モデルアーキテクチャ向けの最適化された GPU カーネルを提供します。