llama.cpp プロジェクトはビルド b10868 をリリースし、Mixture of Experts (MoE) モデルの IQ タイプ処理を導入しました。

  • プルリクエスト #28476 経由で MoE アーキテクチャ内の IQ 量子化タイプをサポートしました。
  • macOS (Apple Silicon および Intel)、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows (CPU、CUDA 12/13、Vulkan、OpenCL、ROCm、SYCL)、Android、および openEuler のバイナリを提供します。
  • iOS XCFramework サポートとスタンドアロン UI パッケージを含みます。

このアップデートにより、ユーザーは幅広いハードウェアプラットフォーム上で特定の IQ 量子化タイプを持つ MoE モデルを実行できるようになります。