llama.cpp プロジェクトはバージョン b11460 をリリースし、SYCL バックエンド内で IQ3_S multi-column MMVQ 量子化フォーマットのサポートを導入しました。この更新は、標準の CPU および GPU アクセラレーション オプションとともに新しいビルドに含まれています。

  • リリースにより、pull request #29500 を介して SYCL 実装に IQ3_S multi-column MMVQ サポートが追加されました。
  • macOS (Apple Silicon および Intel)、Linux (x64、arm64、s390x)、Windows、Android、openEuler のバイナリが提供されています。
  • GPU アクセラレーションは、サポートされているプラットフォーム上で CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、および OpenCL Adreno を介して利用可能です。
  • Linux および Android 上の Snapdragon デバイス用の特定のビルドが含まれており、CPU、Adreno GPU、Hexagon NPU をサポートしています。

このリリースにより、ユーザーは最新の SYCL 最適化にアクセスでき、さまざまなアーキテクチャで llama.cpp モデルを実行するためのハードウェア互換性が拡大します。