llama.cpp プロジェクトはバージョン b10702 をリリースし、AMD の gfx1201 アーキテクチャにおける Q2_0 量子化ドット積パスの特定の最適化を含んでいます。この更新により、HIP 実装がネイティブな amdgcn 置換命令を使用するよう拡張され、この特定のハードウェア構成のパフォーマンスが向上します。
- gfx1201 の `vec_dot_q2_0_q8_1` をネイティブな amdgcn 置換で最適化。
- HIP の Q2_0 置換最適化を拡張し、冗長な可用性ガードを削除。
- ネイティブな置換命令を使用して HIP Q2_0 MMQ アンパックを最適化。
- MMQ タイルインデックス処理を復元し、CUDA コード内の HIP プリプロセッサガードにラベルを付け。
このリリースでは、CPU、GPU(CUDA、ROCm、Vulkan、OpenCL)、および OpenVINO や SYCL などの専用バックエンド向けに、macOS、Linux、Windows、Android、openEuler 用のバイナリが提供されます。