llama.cpp プロジェクトはバージョン b11460 をリリースし、SYCL バックエンド内で IQ3_S multi-column MMVQ 量子化フォーマットのサポートを導入しました。この更新は、標準の CPU および GPU アクセラレーション オプションとともに新しいビルドに含まれています。
- リリースにより、pull request #29500 を介して SYCL 実装に IQ3_S multi-column MMVQ サポートが追加されました。
- macOS (Apple Silicon および Intel)、Linux (x64、arm64、s390x)、Windows、Android、openEuler のバイナリが提供されています。
- GPU アクセラレーションは、サポートされているプラットフォーム上で CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、および OpenCL Adreno を介して利用可能です。
- Linux および Android 上の Snapdragon デバイス用の特定のビルドが含まれており、CPU、Adreno GPU、Hexagon NPU をサポートしています。
このリリースにより、ユーザーは最新の SYCL 最適化にアクセスでき、さまざまなアーキテクチャで llama.cpp モデルを実行するためのハードウェア互換性が拡大します。