llama.cpp プロジェクトはバージョン b10246 をリリースし、特定のモデル構成における OpenCL パフォーマンスの修正を含んでいます。このアップデートは、元の次元条件が大きな重みを処理するのに不十分だった問題を解決します。
- 大型の q6_K lm_head テンサーを gemv_noshuffle の代わりに平坦な GEMV にルーティングします。
- gemma-4 E2B(次元 [1536, 262144])のようなモデルでの速度低下を防ぐために、直接のサイズ条件を追加します。
- macOS (Apple Silicon および Intel)、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA、Vulkan、OpenVINO、SYCL、HIP)、および openEuler 用のバイナリを提供します。
この変更により、OpenCL デバイス上で大きな重み行列がパフォーマンスのボトルネックを引き起こすことなく効率的に処理されることが保証されます。