llama.cpp 项目发布了构建版本 b10414,在 Metal 后端引入了对 GGML_TYPE_TQ2_0 三元量化的支持。此更新还包括对连续张量 (cont) mul_mv 内核的优化。
- 在 Metal 后端添加了 GGML_TYPE_TQ2_0(三元,每个元素 2 位)支持。
- 通过将整数运算切换为浮点运算来优化 mul_mv 内核。
- 通过预计算和、提升系数以及连续 y 加载来提高性能。
此版本为 macOS、Linux、Windows、Android 和 openEuler 提供了更新的二进制文件,涵盖各种硬件后端,包括 CPU、CUDA、Vulkan、ROCm 和 SYCL。