llama.cppプロジェクトはバージョンb10632をリリースし、ggml-metalを介してMamba-2プリフィルのためのチャンク化SSD MMA最適化を導入しました。
- Metal上のマルチトークンプリフィル用のWIPチャンク化SSD SSM_SCANカーネルを追加。
- 順序尾部と組み合わせたMMAに優先してスカラーSSDパスを削除。
- 順序カーネルのロールバックスナップショット用にKトークンを予約し、MMAとseq tail間の並行性をリセット。
- テンプレートを使用してssm_scan尾部を特殊化し、明確さのために定数を更新。
このアップデートにより、CPU、CUDA、ROCm、Vulkan、OpenVINOを含むさまざまなハードウェアバックエンド上で、macOS、iOS、Linux、Windows、Android、openEuler用のバイナリが提供されます。