llama.cpp プロジェクトはバージョン b10657 をリリースし、混合専門家モデル用の新しい OpenCL バイナリカーネルを導入しました。具体的には、互換性のあるハードウェアでの効率的な計算をサポートするために `kernel_gemm_moe_q4_0_q8_1_dp4a_bin` と `kernel_gemm_moe_mxfp4_q8_1_dp4a_bin` が追加されました。
- q4_0/q8_1 および mxfp4/q8_1 の量子化に対応した GEMO MOE 用の OpenCL バイナリカーネルを追加。
- macOS (Apple Silicon および Intel)、iOS、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows (CPU、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm)、Android、openEuler 用のバイナリを提供。
- このリリースでは macOS Apple Silicon での KleidiAI サポートは無効化されたままです。
この更新により、特定の OpenCL カーネル実装を有効にすることで、混合専門家モデルのハードウェア互換性が拡張されました。