llama.cpp プロジェクトはビルド b10868 をリリースし、Mixture of Experts (MoE) モデルの IQ タイプ処理を導入しました。
- プルリクエスト #28476 経由で MoE アーキテクチャ内の IQ 量子化タイプをサポートしました。
- macOS (Apple Silicon および Intel)、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows (CPU、CUDA 12/13、Vulkan、OpenCL、ROCm、SYCL)、Android、および openEuler のバイナリを提供します。
- iOS XCFramework サポートとスタンドアロン UI パッケージを含みます。
このアップデートにより、ユーザーは幅広いハードウェアプラットフォーム上で特定の IQ 量子化タイプを持つ MoE モデルを実行できるようになります。