llama.cpp プロジェクトは、Mamba2 アーキテクチャ向けの重要な最適化を含むビルド b10605 をリリースしました。この更新では、Mamba2 モデルの入力および出力射影を平坦化し、汎用行列ベクトル (GEMV) 演算の代わりに汎用行列乗算 (GEMM) 演算をディスパッチします。

  • mamba2 の入出力射影を平坦化し、GEMV ではなく GMM ディスパッチを有効化。
  • Mamba2 実装内の冗長な出力リシェイプ演算を削除。

このリリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO を含むさまざまなハードウェアバックエンド上で、macOS、Linux、Windows、Android、openEuler 用のバイナリを提供します。