llama.cpp プロジェクトはバージョン b10327 をリリースし、CUDA 上の量子化コピーカーネルの起動におけるスレッド数とブロック数の修正を含んでいます。このアップデートは pull request #26731 で特定された問題を解決します。

  • 正確性を確保するために、不均一なブロック数のコピーケースに対するテストがリリースに追加されました。
  • macOS (Apple Silicon および Intel)、Linux (CPU、Vulkan、ROCm 7.2、OpenVINO、SYCL)、Android、Windows (CPU、OpenCL Adreno、CUDA 12/13、Vulkan、OpenVINO、SYCL、HIP)、および openEuler 用のバイナリが利用可能です。
  • iOS 用 XCFramework とスタンドアロン UI ビルドも提供されています。

このリリースは、幅広いサポート対象プラットフォームにわたる CUDA ハードウェアでの量子化コピー操作の安定した実行を保証します。