llama.cpp 项目发布了构建版本 b10868,引入了对混合专家(MoE)模型的 IQ 类型处理。
- 通过 pull request #28476 在 MoE 架构中添加了 IQ 量化类型的支持。
- 提供 macOS(Apple Silicon 和 Intel)、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Windows(CPU、CUDA 12/13、Vulkan、OpenCL、ROCm、SYCL)、Android 和 openEuler 的二进制文件。
- 包含 iOS XCFramework 支持和独立 UI 包。
此更新使用户能够在广泛的硬件平台上运行具有特定 IQ 量化类型的 MoE 模型。