llama.cppプロジェクトはバージョンb10632をリリースし、ggml-metalを介してMamba-2プリフィルのためのチャンク化SSD MMA最適化を導入しました。

  • Metal上のマルチトークンプリフィル用のWIPチャンク化SSD SSM_SCANカーネルを追加。
  • 順序尾部と組み合わせたMMAに優先してスカラーSSDパスを削除。
  • 順序カーネルのロールバックスナップショット用にKトークンを予約し、MMAとseq tail間の並行性をリセット。
  • テンプレートを使用してssm_scan尾部を特殊化し、明確さのために定数を更新。

このアップデートにより、CPU、CUDA、ROCm、Vulkan、OpenVINOを含むさまざまなハードウェアバックエンド上で、macOS、iOS、Linux、Windows、Android、openEuler用のバイナリが提供されます。