llama.cpp プロジェクトは、Vulkan バックエンド用の特定の最適化を含むビルド b10757 をリリースしました。この更新では、NUM_COLS が 4 より大きい場合に IQ3_S 行列ベクトル乗算に対して 4 より大きいバッチサイズを効率的に処理します。
- 指定された Vulkan IQ3_S mat-vec 構成において n=8 で 5 倍のパフォーマンス向上を実現。
- all_types mat-vec スイープに k=16*256 の各量子化タイプごとに 2 つのケースを追加。
- macOS (Apple Silicon および Intel)、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA 12/13、OpenCL、Vulkan、OpenVINO、SYCL、ROCm)、openEuler 用のバイナリを提供。
このリリースにより、特定の量子化タイプに対して更新された Vulkan 最適化を活用し、幅広いハードウェアプラットフォームで llama.cpp を実行することが可能になります。