llama.cpp プロジェクトはビルド b10988 をリリースし、Mixture of Experts (MoE) モデル用に OpenCL バックエンドに変更を加えました。このアップデートは、推論デコーディングとマルチトークン予測中にバッチサイズに基づいて MoE エキスパート行列乗算を選択するロジックを実装しました。

  • ルーティング数に応じて事前に構築された q4_0 MoE GEMM 操作をゲートします。
  • 効率を向上させるため、パディングされた MoE アクティベーションスロットへのゼロ書き込みを停止します。
  • CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL、Adreno プラットフォーム向けに、macOS、Linux、Windows、Android、openEuler のバイナリを提供します。