llama.cpp プロジェクトはバージョン b11403 をリリースしました。これには、小さなバッチサイズで薄い f16 および bf16 行列乗算に MMVF カーネルを使用する CUDA 最適化が含まれています。

  • NVIDIA GPU でのパフォーマンス向上のためにカーネル選択ロジックを調整しました。
  • macOS (Apple Silicon および Intel)、Linux (CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL、Snapdragon)、Windows (CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android、openEuler 用のバイナリを提供しました。
  • 標準的なバイナリに加えて、iOS XCFramework および UI ビルドを含めました。